DeepSeek为什么敢涨价?
8月10日,Anthropic取消了Claude Sonnet 5原定于9月生效的50%涨价计划。
Sonnet 5在6月底发布时,API首发价为每百万Token输入2美元、输出10美元,原计划9月1日起恢复至3美元和15美元。最新更新显示,这一涨价安排已取消,2美元/10美元将继续作为长期价格。
此前,7月30日,OpenAI大幅下调GPT-5.6 Luna和Terra价格,其中Luna降价80%,Sol价格不变。与此同时,OpenAI还通过减少Codex、ChatGPT Work的额度消耗,以及多次重置付费用户额度,提高同等订阅价格下的可用计算量。换句话说,API和订阅两端都在变相降价。
但是,中国大模型的价格走势却完全相反。
8月11日前后,
7月16日,月之暗面发布
美国头部模型开始压低价格,中国最新最强的一批模型却开始尝试提高单位价格。为什么?
图片由AI生成
01 OpenAI和Anthropic的竞争
美国大模型这轮降价最表面的原因,依然是OpenAI与Anthropic之间越来越激烈的竞争。
6月11日,在OpenAI正式降价之前,已有外媒消息称OpenAI内部正在讨论大幅削减Token价格,目的就是从Anthropic手里争夺用户。
到了7月30日,讨论变成现实。OpenAI精准砍向承担大量Agent执行工作的Terra和Luna。外媒在报道这次降价时直接指出,这会进一步向Anthropic施压:Claude在企业和开发者市场占据重要位置,价格却处于市场较高一端。
Claude Code和Codex争夺的是同一批开发者和企业工作负载。更大的使用规模除了带来收入,也会扩大真实任务和失败反馈的覆盖面。需要注意的是,OpenAI已明确表示,Business、Enterprise和API数据默认不用于训练,因此企业用户增长不能直接等同于训练数据增长。
更准确地说,模型厂商争夺的是工作负载反馈:更多真实任务会暴露Agent在哪些环节失败、重试或调用工具,从而反哺评测、产品和推理策略迭代。
Agent市场开始形成一条新的竞争链条:
降低使用门槛→更多真实任务运行→暴露更多失败模式→改进Agent→再争取更多工作负载
这也能解释Anthropic为何取消Sonnet 5原定50%的涨价。对于Agent主力模型来说,价格会直接影响调用频率;而在Agent场景中,更少步骤完成同样任务,本身就意味着更低成本。
02 中国开放权重模型
但OpenAI和Anthropic之间的价格竞争,只解释了其中一部分。另一股越来越重要的压力,来自中国开放权重模型正在迅速扩大可替代的任务范围。
Citi数据显示,OpenRouter上开放模型处理的Token占比从1月的34%升至6月的65%;当时平台最受欢迎的四个模型全部来自中国。这个数据只代表OpenRouter平台,虽然不能当做全球份额,但可以观察出多模型开发者的选择正在发生变化。
Palo Alto Networks CEO Nikesh Arora当时直接向模型公司喊话:如果想赢得企业客户,就应该按照未来更低的Token价格提前定价。
Coinbase CEO Brian Armstrong预计,未来18个月大约80%的AI工作负载会迁往成本低约99%的模型;旗舰模型仍然适合规划等复杂任务,大量执行工作并不需要如此昂贵的能力。
这里才是中国开放权重模型对OpenAI、Anthropic价格体系真正的压力。
规划和复杂推理交给Claude或GPT,分类、信息抽取、简单代码修改、格式转换等大量步骤交给
中国模型压缩了美国旗舰模型能够收取高溢价的任务范围。
所以OpenAI这次保住Sol的30美元输出价,同时把Luna砍掉80%,其实很有代表性。
守住最强模型的能力溢价,但也很不情愿把海量普通Agent工作白白让给更低价格的模型。
03 企业已经开始把模型当成可替换零件
斯坦福Digital Economy Lab今年4月发布的《Enterprise AI Playbook》,提供了一组很有意思的现实证据。
研究团队调查了41家机构、9个行业、7个国家的51个已经成功部署的企业AI项目。需要强调的是,这个样本专门研究成功案例,因此不能用来推导所有AI项目的平均ROI。
其中一个结果非常值得模型公司警惕:42%的项目认为底层模型完全可以替换。
在常规、规则明确的任务中,这一比例达到71%;到了需要复杂推理、专业知识或高风险决策的高级任务,只有18%认为模型可以随意替换,35%认为模型仍然是关键差异。
一位被斯坦福研究团队采访的科技公司运营负责人已经自己建立了“multi-LLM gateway”。他给出的原则很简单:每一个请求,都在成本、准确率、相关性和延迟之间重新判断,“这个任务真的需要deep search吗?还是mini模型已经足够?”
另一家公司的负责人也有同样的思路,自己的平台搭好之后,可以随时在模型之间切换,“谁变得更好或者更便宜,就转向谁”。
这恰恰是OpenAI和Anthropic现在面对的新市场环境。客户还在,但模型忠诚度正在下降。
04 “完成一件工作多少钱”
企业之所以越来越愿意切模型,还有一个原因:Agent让Token成本被迅速放大。
聊天时代,一个问题对应一次或者几次模型调用。Coding Agent接到一个任务之后,会读文件、制定计划、调用终端、修改代码、运行测试、查看错误,然后再循环。一次用户指令背后可能出现几十甚至上百次调用。
真正的成本越来越接近:任务成本 = Token价格 × Token数量 × Agent步骤 × 重试次数。
对于Agent,多出来的额度会直接变成更多工作。
DRadar是一个由开发者社区维护的Coding Agent实测项目,它让Codex、
当前结果显示,高推理档位通常能获得更高任务表现,但成本会更快上升;
图:开源任务DRadar对真实软件工程任务的实测显示,模型能力提升伴随着明显的边际成本递增:高推理档位可以获得更高IQ,但成本往往以数倍甚至数十倍增长;
所以OpenAI频繁重置Codex额度,与API降价道理相同,就是降低每单位真实工作负载的获取成本。
这也让每百万Token多少钱开始失去一部分解释力。
企业真正关心的指标逐渐变成:Cost per successful task。
一个0.5美元的模型如果需要试40次,可能比5美元但8步完成任务的模型更贵。
斯坦福的企业研究也发现,高自主度系统已经出现明显的生产率优势。在AI自主完成80%以上任务、人类主要处理异常情况的“Escalation”模式下,中位生产率提升达到71%;每个输出都需要人工审批,以及人与AI持续协作的两种模式,中位提升均为30%。研究者同时提醒,这与任务选择有关——高频、结果可验证、错误可恢复的工作更适合高自动化。
Agent已经改变了模型经济学的计量单位。
05 DeepSeek和Kimi,两条不同的“涨价”路线
理解这一点以后,再看中国模型涨价,会发现
它现在仍然便宜得惊人。Artificial Analysis测算V4-Flash跑完其benchmark平均只需约3美分。即便价格翻几倍,它和美国旗舰之间仍然存在足够宽的价格带。
所以
如果价格上涨两三倍,调用基本留下来了,说明
关于定价逻辑,接近
K3的需求至少出现了一个早期信号。模型发布仅数日后,由于需求超过计算能力,Moonshot一度暂停新的
虽然这还是不足以证明K3已经获得成熟定价权,但它说明中国开放权重模型进入全球市场,不再只有“价格做到美国模型十分之一”这一种打法。
06 Token的单价,已经越来越不重要
价格变化只是表层。判断一个模型的商业位置,更重要的是看它是否形成了稳定、持续并能够转化为收入的真实使用。
但目前并不存在覆盖全球模型使用量的完整统计。OpenRouter只能反映部分第三方调用,Hugging Face更偏向开放权重生态,云平台披露的数据也各有边界,任何单一指标都很难还原模型的实际采用情况。
因此,我们尝试做一个简单的模型采用度指数(Model Adoption Index,MAI),作为观察市场的参考,综合真实调用、生产部署、分发渠道、开发者生态、商业变现和持续使用六个维度进行打分;Benchmark、媒体热度和搜索指数不纳入,因为它们更多反映模型能力或市场关注度。
MAI基于目前能够获得的公开信息进行分析性评分,并非行业统计标准。对于刚发布的模型,生产部署和持续使用数据还没有充分形成,也还需要结合证据完整度和上线时间理解分数,不能简单作为模型排名。
这张表真正值得关注的地方,不在于Claude是91分、
Claude的优势集中在企业生产部署和分发渠道;
这也提醒我们,Token调用量和Token的绝对定价越来越难直接代表商业价值。一个模型调用很多,可能只是因为便宜;一个模型价格很高,也不等于真正有定价权。
所以再看今天这场价格分叉,美国模型降价、中国模型涨价,背后其实有三股力量同时发生。
OpenAI和Anthropic正在正面争夺Agent入口。中国开放权重模型又不断扩大廉价模型可以完成的任务范围。Agent和多模型Router则让企业第一次能够真正把每一步工作分配给性价比最高的模型。
价格因此开始向两边挤压。
美国高端旗舰模型过去享有的溢价正在向下压;中国开放权重模型长期依靠的巨大价格优势开始向上收缩。
最终的市场可能既不会出现所有Token无限趋近于零,也不会允许最强模型一直维持几十倍溢价。
真正被重新定价的是Task本身,每天到底有多少真实工作,愿意持续运行在某个模型或某个模型组合上。
本文来自微信公众号“腾讯科技”,作者:值得关注的,36氪经授权发布。















