出品 | 网易智能
作者 | 小爪
编辑 | 王凤枝
几个月前,ZenGen Labs创办人德莫特·麦格拉思还不太愿意把长时间运行的任务交给中国模型。工具调用不够稳定,任务跑久了容易出错,有时模型甚至没完全弄明白要做什么。
现在,他的用法变了。“我仍把Claude Code当架构师,让它制订行动计划和摘要,然后把执行交给DeepSeek。” 麦格拉思告诉彭博。他没有完全放弃更贵的美国模型,而是把一项工作拆开:最难的规划留给Claude,后面大量查询和执行交给成本更低的DeepSeek。
麦格拉思不是个例。过去八周,Qwen3.8-Max、Kimi K3、DeepSeek V4 Flash、GLM-5.2和Seedance 2.5接连推出,覆盖推理、编程、工具调用、长程任务和视频生成。
北京科技分析师、Hello China Tech创办人赵博说:”第一次冲击看起来还像个例,最近这些发布则说明,中国已经形成了一套能够反复推出接近全球前沿模型的体系。“
3美分对3.15美元,价差先显出来
价格表上的差距是一回事,一项工作做完实际要花多少钱,是另一回事。
独立评测机构Artificial Analysis测试了一项复杂现实工作负载。在当时的模型版本和测试条件下,DeepSeek V4 Flash完成任务约需0.03美元,Claude Fable 5约需3.15美元,相差约105倍。
DeepSeek官网显示,V4 Flash当前标准价为每百万输入1元、每百万输出2元。当然,总成本还要看模型实际使用了多少token、是否需要重试,以及任务能否成功交付。
Artificial Analysis在4月测试预览版时指出,V4 Flash跑完整套智能指数消耗了约2.34亿个输出token。 较高的token消耗意味着,尽管其单token价格很低,完成整套测试的总成本仍不是最低。7月31日版本发布后,这一数字降至约2.06亿个,较前代减少12%,表明模型在能力提升的同时,也降低了完成同类任务所需的输出token。
彭博把Artificial Analysis能力—价格图上的一片区域称为”DeepSeek死亡区”,中文网络上更常把它叫作”DeepSeek斩杀线”。 能力足够强的模型可以继续维持高价,能力够用而且很便宜的模型也有一席之地。但夹在中间的模型就非常难堪:能力还不足以让客户接受高价,价格又没有低到足以抵消差距。

国产厂商已经在向两端拉开。阿里的Qwen3.8-Max、月之暗面的Kimi K3和Z.ai的GLM-5.2进入了更高性能区间;字节跳动又用Seedance 2.5把竞争推向视频生成。
海外旗舰模型也出现分层。 Anthropic的Claude Opus 5、Fable 5和OpenAI的GPT-5.6 Sol凭借能力优势稳稳站在斩杀线以上,高价还撑得住。xAI的Grok 4.5、谷歌的Gemini 3.5 Flash、Meta的Muse Spark 1.1只是刚刚跨过门槛,没被DeepSeek从能力和价格两头夹住,但价格仍然高出不少,降价压力还在。
低价模型开始接手更多执行工作
中国厂商正在补过去容易掉链子的长程任务能力。月之暗面称,Kimi K3拥有2.8万亿参数和100万token上下文,面向长程编程、知识工作和深度推理。Z.ai把GLM-5.2定位为长程任务模型,并披露了针对长程编程和工具调用的训练。阿里也把Qwen3.8-Max的长程执行列为改进重点。
月之暗面和阿里都选择了总参数超过2万亿、每次只激活一部分的架构。 这种设计试图在扩大模型容量的同时,控制每一步推理所需的计算量。任务运行得越久,这项取舍越重要:模型需要持续读取上下文、接收工具返回的结果,再决定下一步动作,计算和调用成本也会随之累积。
参数规模不等于任务完成质量。 低价模型想接手执行,得在多轮操作里跟住计划、正确调用工具,遇到结果不对时还能继续处理下去。模型如果频繁跑偏或中途失败,重试很快就会吃掉单价上的优势。
前文麦格拉思的用法提供了一个具体信号。他仍让Claude Code负责架构和行动计划,把后续查询和执行交给DeepSeek。这不足以证明低价模型能独立完成所有复杂任务,但至少说明一种分工在成形:难度最高的规划留给昂贵模型,调用频繁、消耗token的执行环节交给便宜的。
DeepSeek的价格柱,几乎贴在横轴上
彭博在X发布文章后,文中的能力—价格图很快被转发。
开发者安德鲁·柯伦(Andrew Curran)贴出这张图,写道:“我一开始还以为,彭博忘了把DeepSeek的价格画进去。” 该帖当时已有7322个赞和约37万次浏览。DeepSeek的价格确实画在图上,只是柱子太低,乍看几乎贴着横轴。

另一位用户Chubby转发图片后说,DeepSeek V4 Flash的价格优势”根本不是接近一点点”。这条评论获得336个赞。还有用户把GPT-5.6和Claude形容成”奢侈品”:能力更强,但大量日常任务并不需要最贵的模型,原来的报价也因此更难解释。
这些帖子背后是一个更实际的问题:几分钱的模型如果已经够用,只强一点却贵很多的产品,靠什么说服客户继续多付钱?
美国实验室要守住价格,中国厂商也在承担成本
彭博称,OpenAI和Anthropic均在筹备上市,并追求至少1万亿美元估值。这样的估值需要高利润业务支撑。李开复对彭博说,如果没有中国开源模型,OpenAI和Anthropic原本可以轻松获得丰厚利润;现在,客户多了一个更便宜的选择。
中国厂商同样没有轻松赚钱。彭博智库高级分析师罗布·利(Rob Lea)称,它们现阶段把争夺用户、开发者和技术领导地位放在短期盈利之前。
视频生成领域的价格竞争更加激进。彭博称,OpenAI因服务成本较高搁置Sora,快手Kling获得28亿美元融资,字节持续投入Seedance。利估算,Seedance的价格比当时市场主流水平低约99%。
DeepSeek斩杀线会随模型版本、任务类型、工具框架和运行环境变化。 对企业来说,任务完成率、返工次数和最后的总账单,决定一款模型落在线的哪一边。
