混战格局拆解(三类打法):
闭源降价派 DeepSeek(1/60 价守存量)、Grok(半价抢增量)、Google(腰斩止血)——在 API 价格带上正面对撞;
开源围剿派 阿里(Max 开源)、Meta(本地开源)——用"权重免费 + 可自部署"从侧翼瓦解闭源定价权;
旗舰悬念派 Google 3.5 Pro 延期、Anthropic Fable 5 守高端——旗舰真空期被 Flash/开源密集填补。
先看各模型 API 输出价格与性能位次(对数轴;DeepSeek 用 8/17 峰谷价两段标注,避免误导):
注:价格口径(2026-08-14 核验,多源交叉):Claude Fable 5 = $50/百万输出 ≈ 360 元(aipricing.guru 8/13 刷新 + geotoolbox 一致);DeepSeek V4-Pro = 现价 6 元 → 8/17 峰谷定价生效后高峰 27 元 / 空闲 13.5 元(上证报/南都/中国基金报/蓝鲸 8/13 一致);Gemini 3.7 Flash = $3.75 ≈ 27 元(2026 底前引导价,IT之家/品玩/网易 8/14);Grok 4.6 = $6 ≈ 43 元(xAI 官方 + Singularity Moments 8/14)。性能分:Terminal-Bench(DeepSeek 87.9/Fable 5 88,DeepSeek 官方)/ DeepSWE(Gemini 3.7 Flash 65.3)/ AA Index(Grok 4.6 = 61)。
再拆"性能 vs 价格"性价比散点(X=价格(对数),Y=Agent 性能分,气泡=参数规模):
| 厂商 | 模型 | 类型 | 核心能力位 | 输出价(每百万 token) | 相对 Fable 5($50≈360元) | 开源 |
|---|---|---|---|---|---|---|
| DeepSeek | V4-Pro-0813 | 闭源/API | Agent 逼近 Fable 5(CyberGym 83.3 反超) | 现价 ¥6 → 8/17 高峰 ¥27 / 空闲 ¥13.5 | 现价 1/60 → 高峰 1/13 / 空闲 1/27 | ✗(历史开源) |
| 阿里 | Qwen3.8-Max | 开源权重 | 2.4T 参数 / 极限 Agent 测试 | ——(自部署) | 0(本地) | ✅ 首次开源 Max 旗舰 |
| Gemini 3.7 Flash | 闭源/API | 编程/Agent 工作流 | $3.75 ≈ ¥27(2026 底前引导价) | ≈ 1/13 | ✗ | |
| xAI | Grok 4.6 | 闭源/API | 长程智能体(GDPVal 全球第一) | $6 ≈ ¥43 | ≈ 1/8.4 | ✗ |
| Meta | Muse Glimmer | 开源权重 | 本地 Agent(300亿参数) | ——(本地) | 0(本地) | ✅ |
⚠️ 修正说明:DeepSeek 价格此前误标"3 元"(实为输入未命中价),且未体现 8/17 峰谷定价。正确口径:现价输出 6 元(=Fable 5 的 1/60,与鉅亨網"2%""相差 58 倍"口径一致);8/17 后高峰 27 元(1/13)、空闲 13.5 元(1/27)。Gemini 3.7 Flash 引导价有效期至 2026-12-31,2027 起恢复 $1.5/$7.5。评测分值为厂商自报,需第三方复测。
旗舰对决决定"天花板",但 走量模型才是绝大多数公司按天付钱的"日常口粮"——客服分流、文档抽取、批量处理、Agent 循环都在这档跑。同一价格带里,走量档的性价比差距比旗舰更悬殊:
| 模型 | 定位 | 输出价(每百万 token) | Terminal-Bench 2.1 | 性价比定位 |
|---|---|---|---|---|
| DeepSeek V4-Flash | 走量主力(284B) | 现价 ¥2 → 8/17 后 ¥4.5(空闲)/ ¥9(高峰) | 82.7 | 性能越级 + 价格碾压 |
| Qwen3.7-Flash | 超高频简单任务 | ¥0.8(国内) | 未公开 | 价格探底 / 性能待复测 |
| Grok 4 Fast | 低延迟走量 | $0.5 ≈ ¥3.6 | 未公开 | 速度 + 超长上下文卖点 |
| Gemini 3.5 Flash-Lite | 预算档(纯文本) | $2.5 ≈ ¥18 | 54.0 | 价格偏贵 / 性能明显落后 |
| Gemini 3.7 Flash | 最新走量(腰斩价) | $3.75 ≈ ¥27(2026 底前引导价) | 未公开(DeepSWE 65.3) | 降价 50% 仍在走量档偏贵 |
| Gemini 3.6 Flash | 上一代走量主力 | $7.5 ≈ ¥54 | 78.0 | 同档最贵 / 性能被国产压制 |
数据核验(2026-08-14 多源交叉):DeepSeek V4-Flash 价格 = 官方峰谷定价公告(IT之家/搜狐 8/13);Qwen3.7-Flash 价格 = 千问官方国内口径 ¥0.8/输出(腾讯新闻/开机实验室 8/14 引用);Grok 4 Fast = xAI 官方 $0.2/$0.5(llm-stats 交叉);Gemini 系 = aipricing.guru 8/13 + 官方定价页。性能 = Terminal-Bench 2.1 官方排行榜(DataLearner 转载:DS V4-Flash 82.7 / Gemini 3.6 Flash 78.0 / 3.5 Flash 76.2 / 3.5 Flash-Lite 54.0)。Qwen3.7-Flash / Grok 4 Fast / Gemini 3.7 Flash 的 Terminal-Bench 分官方未公布,明确标注"未公开",不编造。
走量档价格阶梯(对数轴,输出价 ¥/百万 token):
性能 vs 价格散点(X=价格对数,Y=Terminal-Bench 2.1;仅收录官方已公布该基准的走量模型):
走量档核心判断:
价格王者 Qwen3.7-Flash ¥0.8/M[7] ↗——探底价,适合超高频简单任务(分流/分类/抽取),省到极致,但长上下文/复杂任务慎用;
性能越级 DeepSeek V4-Flash ¥2/M(8/17 后峰值 9)TB 82.7[5] ↗——比 Gemini 3.6 Flash(¥54 / TB 78)便宜 6~27 倍且性能反超,是走量档性价比天花板,也是五方混战里"降维打击"最狠的一刀;
被压制方 Gemini 走量档整体偏贵:Flash-Lite(¥18 / TB 54)[6] ↗对 DS V4-Flash(¥2 / TB 82.7)——价格差 9 倍、性能差 28 分,Google 走量只剩"生态 + 多模态 + 高吞吐"卖点。
下方曲线模拟"月度推理成本随 token 用量增长"——双对数轴让低用量区(月 100 万~1 亿 token,即一般中小团队的真实区间)拉开区分度。三条线代表三种选择:自部署固定成本高(8×H100 ≈ 10 万/月起步)但摊薄快;闭源 API 零起步、按量线性涨。交叉点即"自部署回本点"。
注:示意曲线。API 线按输出价(DeepSeek V4-Pro 现价 6 元/M,Gemini 3.7 Flash 引导价 ≈27 元/M);自部署线按 8×H100 折旧(约1.5年)+电费+运维 ≈10 万/月固定,超吞吐上限(约50亿 token/月)后加购服务器跳增。双对数轴:横轴=月 token 用量(亿),纵轴=月成本(万元)。仅供结构对比,非精确核算。
主线一:开源从"追赶者"变"围剿者",定价权被从侧翼瓦解。Hugging Face 数据显示中国开源模型下载占比 41% 首超美国[9] ↗、累计破 100 亿次[4] ↗。阿里开 Max、Meta 开旗舰——当最强的权重免费可得,闭源 API 的定价锚被连根动摇。
主线二:价格战从"性价比"升级为"斩杀线"。DeepSeek 现价输出 6 元[10] ↗(=Fable 5 的 1/60)、8/17 高峰 27 元后仍为 1/13[1] ↗[3] ↗;Google Gemini 3.7 Flash 27 元(1/13)[2] ↗、Grok 4.6 43 元(1/8.4)——闭源厂商被迫降价维持客户粘性。真正被挤压的是中间层:性能无优势、又降不起价的模型(如部分 Tier-2 闭源)被上下夹击。
主线三:竞争焦点从"对话"转向"Agent 完成任务"。五家全部押注编程/智能体/多步骤工作流(Terminal-Bench / DeepSWE / GDPVal / CyberGym)[5] ↗——"谁能以更低成本完成复杂任务"成为新胜负手,单任务 token 消耗指数级放大,反向利好推理算力与存储需求。
反向声音(关键):Google 旗舰 3.5 Pro 延期两月、DeepMind 换帅、人才流失——"Flash 高频迭代 + 降价"可能掩盖旗舰乏力的隐忧;DeepSeek 8/17 涨价后斩杀线刀钝一半,需观察涨价后性价比是否守住;开源"免费"背后是自部署的工程与硬件成本,非真零成本。
① 价格数据已多源交叉核验:DeepSeek 峰谷定价(8/17 生效,Pro 输出高峰 27/空闲 13.5 元)= 上证报/南方都市报/中国基金报/蓝鲸新闻 8/13 一致报道;Fable 5 = $10/$50 每百万(aipricing.guru 8/13 刷新 + geotoolbox 一致,输出 ≈360 元);Gemini 3.7 Flash = $0.75/$3.75 引导价至 2026-12-31(IT之家/品玩/网易 8/14);Grok 4.6 = $2/$6(xAI 官方 + Singularity Moments)。
② 修正记录:初版误用 DeepSeek 输入价 3 元当输出价、且未体现 8/17 峰谷——已改为现价 6 元 + 高峰/空闲两段口径,性价比结论随之修正(1/120 → 1/60 现价 / 1/13 高峰)。
③ 评测分值为各厂商官方自报(DeepSeek 官方群评测表/Google 官方/xAI 官方),需第三方独立复测;竞品分值为厂商自述。
④ 中国开源下载占比 41% = Hugging Face《2026 春季报告》转引(第三方口径)。
⑤ 成本曲线为示意模型(8×H100 折旧+电费 vs API 按量),非精确核算。
说明:以上链接均已于 2026-08-14 实测可达(HTTP 200)。Qwen3.7-Flash / Grok 4 Fast / Gemini 3.7 Flash 的 Terminal-Bench 分官方未公布,未列入 [5] 排行榜,故无对应链接。厂商自报性能分(DeepSeek 87.9 / Google DeepSWE 65.3 等)以官方发布为准。