北京时间 8 月 12 日晚至 13 日凌晨,全球前沿模型市场被两枚深水炸弹接连引爆:
① Grok 4.6(8/12 深夜,高调):马斯克旗下 xAI 发布新一代旗舰,主打长程智能体 / 复杂编程 / 知识工作。官方称 AA Intelligence Index 61 分追平 GPT-5.6 Sol,并在 GDPVal-AA v2(真实世界专业任务)拿 1753 Elo[1] ↗ 全球第一(超 Fable 5 的 1741、超 GPT-5.6 Sol 的 1728)。API 定价 $2/$6[1] ↗(输入/输出,百万 tokens)——约其他前沿旗舰一半价格,已上线 Cursor、Grok Build 与 API。
② DeepSeek V4-Pro-0813(8/13 凌晨,低调):DeepSeek 官网 API 文档悄然把 V4-Pro 从预览版切到正式版,100 万上下文 + 38.4 万最大输出,支持思考/非思考模式、Tool Calls、Responses API + Anthropic API 双兼容。官方群评测显示多项智能体测试逼近甚至反超 Claude Fable 5(如 Terminal-Bench 87.9 分[2] ↗、AutomationBench 31.8 分),价格暂维持 3 元/6 元[2] ↗——同时预告"近期大幅上调 API 定价"。
为什么"撞车"重要:这不是两款新模型的巧合同日发布,而是两种完全不同的低价战略在同一天向 OpenAI / Anthropic 的传统定价体系开火——一个用"白菜价 + 双协议兼容"端存量迁移,一个用"半价 + 第一梯队性能"抢增量开发者。行业分析师普遍认为,这标志着前沿模型竞争从"拼最强"转向"拼性价比 + 拼生态锁定"。
以下是两场发布的核心评测数据(官方/媒体汇总,标注各自来源,第三方独立复测仍需关注):
| 评测项(越强越好) | DeepSeek V4-Pro-0813 | Grok 4.6 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|---|
| AA Intelligence Index | — | 61 | 62 | 61 | — |
| GDPVal-AA v2(Elo) | — | 1753(第一) | 1741 | 1728 | — |
| CursorBench v3.2 | — | 69.9% | 70.5% | 67.2% | — |
| DeepSWE(软件工程 Agent) | 62.7(预览12.8→62.7) | 65.9% | 70.0% | 73.0% | 58.0% |
| Terminal-Bench 2.1 | 87.9(近超 Fable) | — | 88.0 | — | 85.0 |
| AutomationBench | 31.8(超 Fable) | — | 29.1 | — | 27.2 |
| CyberGym(安全 Agent) | 83.3(超 Fable) | — | 83.1 | — | 78.3 |
| Final Human Exam(带工具) | 60.0 | — | 63.0 | — | 57.9 |
注:DeepSeek 数据来自官方群流传评测表(媒体引用,非官方正式发布,需第三方复测);Grok 数据来自 xAI 官方新闻稿(x.ai/news/grok-4-6),引用的竞品分值为各家自公布系统卡/榜单。分项缺失=官方未公布该项,不代表能力缺失。
昨晚的解读页拆过 DeepSeek 的"斩杀线"(要么降价匹配、要么明显领先,否则淘汰)。今天两场发布把这条线从单点变成了合围之势:
| 模型(百万 tokens) | 输入 | 输出 | 相对 Grok 4.6 输出价 | 相对 DeepSeek Pro 输出价 |
|---|---|---|---|---|
| DeepSeek V4-Pro 0813 | $0.435 | $0.87 | 0.14× | 1× |
| DeepSeek V4-Flash 0731 | $0.14 | $0.28 | 0.05× | 0.32× |
| Grok 4.6 | $2 | $6 | 1× | 6.9× |
| GPT-5.6 Terra | $2 | $12 | 2× | 13.8× |
| Gemini 3.1 Pro | $2 | $12 | 2× | 13.8× |
| Claude Opus 5 | $5 | $25 | 4.2× | 28.7× |
| GPT-5.6 Sol | $5 | $30 | 5× | 34.5× |
| Claude Fable 5 | $10 | $50 | 8.3× | 57.5× |
DeepSeek 人民币价按 1 美元≈7.2 元折算;工作日高峰时段(9:00-12:00、14:00-18:00)DeepSeek 价格为平峰 2 倍。Grok 4.6 维持 4.5 原价,称输入较竞品便宜约 80%、输出约 88%(xAI 口径)。
两个价格锚点同时下移:DeepSeek 把"近旗舰性能"的价格锚钉在 $0.87 输出(Fable 5 的 1/57),Grok 4.6 把"第一梯队智能体"的锚钉在 $6 输出(Sol 的 1/5)。中间层(Terra、Gemini Pro)反而成了最尴尬的位置——性能没有绝对优势、价格又被上下夹击。
DeepSeek + Grok 同时把"第一梯队性能"的价格预期打下来,传统旗舰的"性能溢价"叙事被稀释。但要注意:Fable 5 / Sol 在被追上的项目上仍领先(CursorBench Fable 仍 70.5%、DeepSWE Sol 仍 73%),且闭源厂商的生态锁定(企业合规、渠道、Agent 生态)不会因为价格就崩塌。更现实的传导是:OpenAI / Anthropic 要么继续砸钱保持领先(利润承压),要么被迫降价(利润承压)——"两条路都疼"。
输出价 $0.87(DeepSeek Pro)/$6(Grok 4.6)意味着Agent 级应用(大量推理调用)的成本假设可以重写。长上下文 + 低价 + 双协议兼容,把"用模型堆出来的产品"的边际成本压到可规模化的区间——利好 Agent 创业、代码智能体、垂直知识工作工具。行业观察人士感叹:xAI 的进化速度超出预期。
DeepSeek 的兼容与低价策略,叠加腾讯 Q2 资本开支 527.8 亿元、同比 +176%(自由现金流转负 138 亿)、国产算力采购加速——降价把规模引向国产模型,规模把资本开支引向国产算力,形成与美国闭源 API 模式对打的另一极。对 A 股的意义:算力/服务器/数据中心/电力链的景气有数据支撑,但需甄别"真受益"与"概念炒作"。
一句话总结:8/12-13 的"撞车"把前沿模型竞争推进到价格战 2.0——DeepSeek 用"近旗舰性能 + 1/57 价格 + 双协议兼容"端存量,Grok 用"第一梯队 + 半价 + 进 Cursor"抢增量;真正的输家不是 OpenAI/Anthropic,而是没有性能优势又降不起价的中层模型。
下一步跟踪:① DeepSeek 涨价幅度与时间(斩首线是否回鞘);② 0813 是否开源权重(强化国产生态);③ Grok 4.6 第三方独立复测(官方自测需验证);④ Fable 5 / Sol 的降价或升级回应。