DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说

发布时间:2026/9/29 8:23:22

DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说 一句话总结DeepSeek V4-Pro 旗舰模型今天正式 GAAgent 能力据报暴涨DeepSWE 从 12.8 飙到 62.7价格比 Claude Fable 5 便宜约 46 倍——但所有跑分都是 DeepSeek 自己发的还没有任何第三方验证过。便宜是真的强不强得再等等。导语你的 API 账单还好吗如果你是一个天天挂着 Claude Code 或者 GPT 写代码的人最近几个月大概率有过一个念头“这 API 账单能不能便宜点”Anthropic 的 Fable 5 输出 token 要 $50 每百万——跑一轮复杂的 agent 工作流几十刀就没了。GPT-5.6 Luna 刚降了价输入 $0.2/M 输出 $1.2/M已经很有诚意了。但 DeepSeek V4-Flash 的 $0.14/$0.28 直接把地板价又踩穿了一层。然后今天8 月 12-13 日DeepSeek 的旗舰模型 V4-Pro 也正式转正了——版本号 0813从预览版变成了 GAGeneral Availability。号称 Agent 能力暴涨号称追平甚至部分超越 Claude Fable 5号称只要 Fable 5 的 1/46 价格。听起来是不是太好了所以这篇就帮你看懂什么是真的、什么有水分、什么完全还没验证。想自己动手试 官方定价页DeepSeek API Pricing 多供应商入口OpenRouter — DeepSeek V4 Pro KOL 快评Simon Willison — V4 Pro 0813 详细验证报告The Cherry Creek News — 0813 GA 分析 今天到底发生了什么一句话DeepSeek V4-Pro 从预览版转正成正式版了。具体说DeepSeek 在自己的 API 定价页上把deepseek-v4-pro端点的版本号更新成了DeepSeek-V4-Pro-0813。OpenRouter 也同步上线描述里白纸黑字写着 “This is the GA release of DeepSeek V4 Pro”。同时DeepSeek Chat 网页版和客户端也用上了这个版本——普通用户打开就能免费用到DeepSeek 至今没有消费级付费订阅chat 是完全免费的。模型本身没有架构变化仍然是 MoE混合专家架构简单说就是总参数巨大但每次推理只激活一小部分专家上场1.6 万亿总参数、490 亿激活100 万 token 上下文窗口最大输出 38.4 万 token。MIT 开源许可。这些都和 4 月 24 日预览版发布时一致。变的是后训练和 Agent 能力。DeepSeek 自己发布了一组对比图表——把 0813 和 4 月的预览版做了基准对比基准预览版0813 GA涨幅Terminal-Bench 2.172.187.915.8CyberGym52.783.330.6DeepSWE12.862.749.9AutomationBench12.831.819.0DSBench-Hard31.167.236.1DeepSWE 从 12.8 涨到 62.7——接近 50 个百分点的跳升这种增幅在 AI 基准里几乎闻所未闻。但请先记住这个数字后面会说到它的来源问题。有意思的是这次 GA 还有一个家务事的背景。7 月 31 日 DeepSeek 把更便宜的 V4-Flash 先转正了公测版结果 Flash 在 9 项 Agent 基准上反超了自己的旗舰大哥 Pro 预览版。旗舰模型被自家小弟打脸两周后 V4-Pro-0813 就带着暴涨的 Agent 跑分来了——核心叙事就是旗舰夺回了 Agent 王座。DeepSeek 官方没这么说过但这个时间线和数据走向你品。 便宜到什么程度先把那个1/57的口号掰扯清楚网上流传一个说法“V4-Pro 是 Fable 5 价格的 1/57”。这个数字有没有道理有但它是被高度压缩过的。kingy.ai 做了个事实核查结论是这样的输出 token 单独算V4-Pro $0.87/M vs Fable 5 $50/M确实是大约 1/57输入 token 单独算V4-Pro $0.435/M vs Fable 5 $10/M大约是 1/23混合负载实际算输入输出综合大约1/46所以异常便宜这个定性判断完全成立——但1/57把三个不同口径的数字压缩成了一个严格来说是误导。更准确的说法是“大约 1/46”。给你一个更直观的参照模型输入 $/M输出 $/M备注DeepSeek V4-Pro$0.435$0.87永久价原价 $1.74/$3.48DeepSeek V4-Flash$0.14$0.28比 Pro 还便宜 3 倍GPT-5.6 Luna$0.2$1.2刚降过价Claude Fable 5$10$50前沿旗舰Kimi K3$3$15中国同梯竞品5 月 22 日DeepSeek 把 V4-Pro 的 75% 促销折扣变成了永久价——不是限时活动了是长期 list price。这意味着你可以放心签 12 个月的企业合同了不用担心下个月价格弹回去。但是总是有但是的DeepSeek 定价页上同时挂了一条声明——“计划在近期上调整体 API 定价预计会有显著增长”。具体涨多少、什么时候涨都没说。所以当前这个价格更像是窗口期价格而不是永久承诺。 Agent 跑分暴涨先看看数据是怎么来的回到那个 DeepSWE 从 12.8 飙到 62.7 的数字。这个增幅大不大大得离谱。能不能信目前只能信一半——“数字确实是 DeepSeek 发的”但有没有那么强还没有任何人独立验证过。几个事实帮你判断这些数据的质量来源是 DeepSeek 自己的对比图表通过官方 WeChat 群和 X 账号发布被博客转载传播。Reddit 上有人搬运被版主以低质量为由删除了benchable.ai 上该模型的页面是空的——第三方基准平台还没有任何结果DeepSeek 官方 changelog 没有 GA 发布的条目——最后一次更新还停在 7 月 31 日 Flash 公测的公告0813 的开源权重还没发布——HuggingFace 上仍然托管的是 4 月预览权重月下载超 140 万次的也是那个旧版本对比基线是自家预览版不是竞品——也就是说涨了 50 个百分点的参照物是自己的旧版本不是 Fable 5 或 GPT-5.6更值得注意的一个细节那组 Agent 图表用的是 Terminal-Bench2.1而 4 月预览版发布时的标准基准表用的是 Terminal-Bench2.0——不同版本分数不可直接比较。所以你看到预览版 Terminal-Bench 67.9和0813 Terminal-Bench 87.9时别急着算差值它们用的可能不是同一套卷子。Simon Willison知名 AI 博主在他的博客里提到一个耐人寻味的细节他测试时发现 V4-Pro 在不同推理强度low/medium/high下生成的图片差异极大——“没有其他模型有这种程度的差异”。这意味着推理强度对输出质量的影响可能比其他模型显著得多选对档位很重要。总结一下数据可信度DeepSeek 自己的标准基准4 月发布的 SWE-Bench、LiveCodeBench 等已经被多个第三方验证过大体靠谱。但 0813 的 Agent 大幅提升数据目前完全是孤证——只有 DeepSeek 一家在说没有任何人复现。‍ 开发者社区怎么说Hacker News 是这次讨论的主战场。V4 系列今年 4 月首发的主帖拿到了 2091 分和 1607 条评论——HN 近期最热的 AI 话题之一。社区反馈大致是6 成正面、3 成谨慎、1 成负面。说好的那拨人主要激动于成本“在 max reasoning 设置下我的 credit 余额几乎不动”——这是真实 API 用户反馈有人估算加上 agentic 工作流中典型的缓存命中率实际花费比 Claude Opus 便宜约 60 倍DeepClaude 项目把 V4-Pro 塞进 Claude Code 的 agent loop 里跑在 HN 拿了 678 分说明用 DeepSeek 引擎跑 Claude Code的需求真实存在LiveCodeBench 93.5 分是同表所有模型最高Codeforces rating 3206 也压过 GPT-5.4 的 3168说不好的那拨人给了一个特别有杀伤力的真实对比“Deepseek 4 pro跑了 12 分 02 秒花了 $0.12——有 bug。Grok 4.6跑了 3 分 18 秒花了 $1.41——没 bug。”十二美分跑出来一个带 bug 的结果和一块四跑出来一个干净的结果——这个对比精准地命中了便宜 ≠ 好的痛点。当然正如另一位 HN 用户说的“这是非确定性系统单次试验不能大幅更新你的先验。” 一个样本说明不了什么但至少提醒我们跑分和实际使用体验之间可以有巨大鸿沟。还有几个反复被提到的关切隐私政策“DeepSeek 的隐私政策异常糟糕——他们可以用你的 prompt 和补全做训练。” 对企业级敏感数据来说这是一条硬伤推理速度高负载时段明显变慢。DeepSeek 的计算资源只有约 2 万张 H100在高并发下推理会慢到爬行基准方法论质疑有人指出harness测试框架的权重几乎和模型本身一样大意思是你换个测试工具链可能分数完全不一样 几个你该知道的信号在你考虑要不要切到 V4-Pro 之前有几个信号值得放在心上第一DeepSeek 7 月的 token 消耗量已经仅次于 Anthropic8 月大概率登顶。这意味着它正在获取全球最大规模的用户交互数据——这些数据直接喂给后训练可能形成用户越多→数据越多→模型越强→用户更多的飞轮。从行业竞争角度看这是一个值得关注的结构性优势。第二V4-Flash 可能是更务实的选择。Flash 只要 $0.14/$0.28 每百万 token比 Pro 还便宜 3 倍而且 Terminal-Bench 2.1 已经到了 82.7——和 Pro 的 87.9 差距不大。如果你的工作负载是日常编码、分类、摘要、RAG 检索Flash 的性价比可能比 Pro 更高。Pro 真正的价值在于最难的 agentic 长链任务那种需要几百步工具调用的场景。第三0813 的开源权重还没出来。如果你是要自托管的研究者或企业现在能用的还是 4 月的预览权重。DeepSeek 没说什么时候发 0813 权重也没说 GA 版和预览版在模型本体上是否有区别——可能只是后训练不同也可能是全新 checkpoint。第四今天是三连发的一天。除了 V4-Pro GAGrok 4.6 也发布了Intelligence Index 61只有 GPT-5.6 Sol 价格的五分之一阿里也上线了第一个开源 Qwen-Max。三家公司同日发旗舰——AI 模型的迭代节奏已经从季度旗舰加速到月度旗舰了。这对消费者是好事但也意味着你现在选的模型下个月可能就不再是性价比最优了。把话说明白回到开头那个问题“这 API 账单能不能便宜点”答案是能而且便宜得超出预期。V4-Pro 的定价在当前市场上确实是碾压级的——同等质量的工作负载花不到 Fable 5 的零头这不是营销话术是定价页上白纸黑字的数字。Reuters 引用研究机构的结论也说DeepSeek 是知名模型中运行成本最低的。但便宜和好用之间还有一段路。Agent 能力暴涨的数据目前只有 DeepSeek 自己在说benchable.ai 空空如也社区实测也有十二美分跑出 bug的案例。V4-Pro 在编程基准上的实力LiveCodeBench 全场最高、Codeforces 领先 GPT-5.4是多方验证过的但 0813 新增的 Agent 提升是否如报所述还需要时间检验。一个务实的做法先用起来用你自己的真实工作负载测别只看跑分表。DeepSeek Chat 是免费的API 成本低到你可以在 max reasoning 下跑几十轮都不心疼。如果在你自己的任务上 V4-Pro 的表现够用——那这个价格就是真的香。如果在你的场景下频繁出 bug 或者速度慢到影响效率——那再便宜也不值。毕竟AI 模型是非确定性系统。你的场景、你的 prompt、你的任务复杂度才是最终的决定因素。跑分表只是参考——而参考的价值取决于参考本身站不站得住。参考来源DeepSeek API 定价页一手/官方— https://api-docs.deepseek.com/quick_start/pricingOpenRouter DeepSeek V4 Pro 模型页一手/平台— https://openrouter.ai/deepseek/deepseek-v4-proUnite.AI — DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview垂直媒体— https://www.unite.ai/deepseek-ships-v4-pro-as-its-flagship-model-leaves-preview/Wccftech — V4-Pro-0813 定价与 token 消耗分析垂直媒体— https://wccftech.com/deepseek-prices-its-new-v4-pro-0813-model-at-0-87-per-1-million-output-tokens-as-the-high-flying-chinese-ai-lab-wows-with-its-soaring-token-consumption/Simon Willison’s Weblog — V4 Pro 0813 快评社区/KOL— https://simonwillison.net/2026/Aug/12/deepseek-v4-pro-0813/The Cherry Creek News — 0813 GA 详细验证报告垂直/分析— https://thecherrycreeknews.com/deepseek-v4-pro-0813-ga-pricing-benchmarks-analysis-cherry_creek/DeepSeek Benchmarks 2026 — 标准基准全表垂直/分析— https://deepseekai.guide/news/deepseek-benchmarks-2026/Hacker News V4 主帖社区— https://news.ycombinator.com/item?id47884971作者lusca版本lusca-report-blog v1.0.0出处https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog
延伸阅读

更多相关文章

2026/9/27 10:53:36

数学建模竞赛实战指南:从问题拆解到模型实现

1. 从“妈妈杯”到实战:一份写给建模新手的万字拆解指南如果你正在为2026年的MathorCup(俗称“妈妈杯”)数学建模挑战赛做准备,或者对数学建模竞赛跃跃欲试,那么你大概率已经看过不少“三天速成”、“万能模板”之类的…

2026/9/29 8:39:28

Go 高性能 Web 实战:fasthttp vs net/http 全景对比

Go 高性能 Web 实战:fasthttp vs net/http 全景对比性能敏感的 Web 项目常问:"选 net/http 还是 fasthttp?"本文从 API、特点到 benchmark 一次性解答。一、net/http 主流 import "net/http"http.HandleFunc("/hell…

2026/9/29 8:39:28

用 WeChatMsg 导出微信历史并生成年度报告

用 WeChatMsg 导出微信历史并生成年度报告 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/WeChatMsg WeChatMsg 是…

2026/9/29 8:39:28

Java操作Redis:客户端选型、序列化与分布式锁实战指南

最近在折腾 Redis 相关的项目,发现不少同行在 Java 操作 Redis 客户端这块还在"能用就行"的阶段。Jedis、Lettuce、Redisson 到底怎么选?连接池参数调多少合适?序列化器的坑踩了也不知道怎么排查?这些都是实际开发里绕不…

2026/9/29 8:34:27

【Codex教育管理系统】接入音频转录服务维护转写参数与音频文件入口

音频转录服务在教育管理系统中的价值,在于围绕 音频转录服务 的核心字段、接口动作和页面状态维护业务数据。模块需要和现有接口、权限、页面状态保持一致,不能只写成普通后台表格。 本文基于 系统功能/三方服务_音频转录服务 对应源码,把业务目标拆成模型字段、接口规则、页…

2026/9/28 3:03:23

东莞市品牌网站建设报价常见报错与解决

东莞品牌网站建设报价单背后:一份保姆级建站教程避坑实录 网站做好了没人访问,这大概是很多老板最头疼的事。花了大几万做的品牌站,上线后流量惨淡,比路边摊还冷清。别急着骂外包公司,很多“东莞品牌网站建设报价”里藏着不少猫腻,比如用模板站冒充定制…

2026/9/28 6:05:15

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解

如何划分训练/验证集:Spirula Studio五种eval_mode策略详解 【免费下载链接】spirula-studio Cross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA. 项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio Sp…

2026/9/29 7:00:49

SEO怎么推广速查手册新手避坑实战指南

SEO怎么推广速查手册新手避坑实战指南 模板网站太丑不够用?别急着加滤镜,那是治标不治本。很多老板盯着后台流量掉得眼红,却还在纠结首页Banner的圆角是不是3像素。这就像穿着西装去挖土,姿势不对,努力白费。我整理这份 速查手册…

2026/9/29 0:04:04

AI Evals实战指南:从零搭建LLM应用评估体系与CI/CD集成

1. 为什么AI Evals值得你花时间搞明白做LLM应用的人,迟早会撞上同一堵墙:模型输出飘忽不定,今天答得好好的,明天换个问法就胡说八道。你改了一版提示词,感觉好像好了点,但到底好了多少?说不清。…

2026/9/29 0:04:04

Java采购管理系统实战:从数据库设计到事务一致性

简介:这是一套面向Java Web初学者与课程设计者的采购管理系统完整源码,采用JSP技术搭建,配合MySQL数据库,用于解决企业采购信息的管理问题,适合作为毕业设计、课程大作业或进销存类项目的参考模板。系统实现了用户登录…

2026/9/29 3:53:39

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/26 19:58:38

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/29 6:36:14

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑