mt logoMyToken
ETH Gas
EN

中国大模型的斩杀线,被斩杀了

Favoritecollect
Shareshare

作者: 律动

10 月 8 日,Anthropic 发布 Haiku 5.5。对于不超过 10 万 token 的短请求,每百万 token 输入收 0.1 美元、输出收 0.5 美元,只有上一代 Haiku 4.5 的十分之一。

当天上午,Dragonfly 管理合伙人 Haseeb Qureshi 在 X 上贴出两张 Artificial Analysis 的散点图,配了一句:

「If you want the cheapest LLMs, you should now buy American.」

(想要最便宜的大模型,现在该买美国货了。)

散点图的横轴是完成一次基准任务要花的钱,纵轴是得分。连接所有最优解的那条虚线,在微观经济学里叫帕累托前沿,线上每一个点都意味着,在同等成本下你找不到更聪明的模型。

6 月那张图上,虚线最便宜的那一端,是小米 MiMo、DeepSeek V4 Pro、MiniMax-M3 和智谱 GLM-5.2,几乎全是中国大模型的名字。

到了 10 月 8 日,整条线被 Anthropic 和 OpenAI 接管。中国模型只剩下一个 MiMo 还勉强挂在边缘,智谱 GLM-5.3-Flash 和 DeepSeek V4.1 Flash 则被一掌推到了 Haiku 5.5 的右下方,意味着相比之下它们花得更多,得分更低。

当天港股开盘,大模型概念股应声下挫。上午 10 点 26 分,MiniMax 跌幅扩大至 10%,智谱跌 5.6%。午盘恒生科技指数跌 1.93%,两家大模型新贵跑输大盘近五倍。

过去两年,中国开源与高性价比模型,给全球大模型市场焊死了一条斩杀线。只要把价格压进泥地,海外走量档的闭源模型就难以为继。硅谷明星公司排着队把底层管道换成中国开源大模型。

如今,牌桌被掀了。

斩杀线,被斩杀了。

斩杀线的形成

2023 年 3 月 GPT-4 刚上线时,8K 上下文版本的官方报价是每百万输入 30 美元、输出 60 美元。

智能极度稀缺,供给由极少数硅谷寡头垄断,价格完全是卖方市场。那是一个相信「智力可以单独溢价」的蜜月期。

打破这一神话的,是一家由中国量化对冲基金孵化的技术团队。2024 年 5 月 6 日,DeepSeek 推出 V2。2360 亿总参数,每个 token 仅激活 210 亿;依靠 MLA 架构与极致的工程剪裁,团队将 KV cache 砍掉了 93.3%,吞吐量拉升至 5.76 倍。省下来的算力直接折现为商业定价,每百万输入 1 元人民币,输出 2 元。

国内大厂几乎是被生拉硬拽拖进价格战的。

5 月 15 日,字节跳动火山引擎发布豆包,主力模型给出 0.0008 元/千 token 的企业价,宣称比行业均价便宜 99.3%。5 月 21 日,阿里云宣布通义千问系列断崖式降价,Qwen-Long 输入端折合每百万 token 仅收 0.5 元;数小时后,百度文心两款主力模型直接宣布免费。

到了 8 月,DeepSeek 进一步引入硬盘缓存技术,缓存命中的输入 token 每百万仅收 0.1 元。

当时的大洋彼岸,巨头们并未全盘跟进。2024 年 7 月 OpenAI 发布 GPT-4o mini,输入输出降至 0.15 美元与 0.6 美元;但四个月后 Anthropic 推出 Claude 3.5 Haiku,标价反而是上一代的四倍。Dario Amodei 当时的逻辑是,模型更聪明了,定价必须体现智力进阶。

真正让硅谷感受到彻骨寒意的,是 2025 年 1 月。

DeepSeek-R1 横空出世,推理表现直逼 OpenAI o1,而输出每百万 token 仅需 2.19 美元,而那时 o1 的报价是 60 美元。

1 月 27 日,英伟达单日市值蒸发近 5890 亿美元,创下美股历史纪录。Marc Andreessen 将其称为 AI 领域的斯普特尼克时刻,微软 CEO Satya Nadella 在社交平台上感慨说,杰文斯悖论又灵验了。

斩杀线自此成形。

开放权重让这柄利刃更加锋利。面对闭源模型,客户只能在几份垄断价目表间做算术;而权重一旦开放,开发者既能在自己的集群上私有部署,也可以在任何一家第三方推理云上跑起同样的模型。同一个模型有了多家供应商,客户也多了自行部署的选择,模型提供方维持高溢价的空间随之缩小。

一批美国本土公司率先过了河。

2025 年 10 月,Airbnb 首席执行官 Brian Chesky 公开表示,公司的智能客服 Agent 极度依赖阿里千问,整个系统调度了 13 个模型,虽然也接入了 OpenAI 最新的旗舰,但在生产流水线里极少被调用,因为有更具性价比的替代品。

同月,Cognition 推出 SWE-1.5,宣称构建在「某个行业领先的开源基座」之上,智谱随后证实,该底座正是 GLM-4.6。

紧接着,a16z 合伙人 Martin Casado 对《经济学人》透露,带着开源模型架构来路演的美国 AI 初创企业中,大约八成用的是中国基座。

今年 3 月,代码编辑器 Cursor 发布 Composer 2,定价每百万输入 0.5 美元、输出 2.5 美元,团队最终承认基座调优自月之暗面的 Kimi K2.5。

开发者在用代码与预算投票。Mozilla 发布的报告显示,中国开放权重模型在 OpenRouter 上的 token 份额,从 2024 年底的不足 2%,升至 2026 年 4 月的超过 45%。

在走量与结构化调用的生态位上,高傲的闭源模型一度毫无还手之力。

代价

斩杀对手,并不必然意味着自己活得体面。

Mozilla 的同一份报告里,还有一组对照数据。2025 年 5 月至 9 月,开放模型约占 OpenRouter 平台两成的模型使用量,却只获得约 4% 的模型层收入。这是一个平台在特定时期的样本,不能代表全球市场,但使用份额与收入份额之间的落差已经十分明显。

创造价值,从来不等于捕获价值。

今年 1 月,智谱与 MiniMax 相继敲钟。随后披露的中期业绩,让外界得以看清收入增长背后的成本与亏损。

智谱上半年收入 9.54 亿元,其中开放平台及 API 业务收入 8.25 亿元,占比达到 86.5%。这项业务的毛利率已经由负转正,升至 24.6%;但公司整体仍录得约 20.72 亿元净亏损,同比收窄 12.1%。卖出更多 token 开始产生毛利,但是距离覆盖公司的全部开支,还有一段距离。

MiniMax 上半年营收约 1.17 亿美元,同比增长 283.1%;净亏损约 3.58 亿美元,同比收窄 11%。剔除股份支付、金融负债公允价值变动及上市费用后,经调整净亏损约 2.93 亿美元,同比扩大 111.2%。

上市之后,低价带来的增长需要接受另一重检验。每一次调用究竟能留下多少毛利,这些毛利又能覆盖多少研发与运营开支。收入增长很快,距离公司整体盈利仍然很远。

今年春末,Agent 浪潮将算力消耗推向了临界点。

开源项目 OpenClaw 席卷全球开发者社区,至 3 月初在 OpenRouter 上的累计 token 消耗突破 8.52 万亿,雄踞榜首。3 月中旬的一周内,中国模型单周跑出了 7.36 万亿 token,环比激增 56.9%。

2 月 12 日上线的 GLM-5 一度登顶调用榜,汹涌的需求在瞬间击穿了基础设施配额。海外与国内开发者开始密集抱怨 GLM Coding Plan 出现秒级延迟和高频限流,这是中国头部 AI 团队首次公开告急求算力。

2 月 23 日,智谱单日股价暴跌近 23%,一日之内蒸发逾 700 亿港元市值。

接踵而至的,是一轮防御性涨价。

智谱在 GLM-5 推出时上调资费,3 月的 GLM-5-Turbo 价格再度上浮 20%,整体较上一代规格平均贵了 83%。

DeepSeek 在 4 月 24 日发布的 V4-Pro 拥有 1.6 万亿总参数,上线即给予 75% 峰值折扣。这把火先烧向了同行,MiniMax 两个交易日连续下挫约 9% 和 10%。

但到了 8 月中旬,DeepSeek 亦转入分时计费策略,V4-Pro 高峰期输出每百万 token 攀升至 3.96 美元,缓存命中成本上涨超 12 倍。

7 月,月之暗面发布 Kimi K3,API 标价推升至每百万输入 3 美元、输出 15 美元,比 K2.6 整整贵出三倍多。

不过,令人意外的是,涨价并未引发剧烈的客户流失。

智谱 CEO 张鹏公开透露,一季度调价 83% 后,API 调用规模反而激增了 400%。至 8 月底,智谱 MaaS 平台的年化收入摸高到 16 亿美元,API 业务毛利率奇迹般转正至 24.6%。

在算力供不应求的数月窗口期内,中国模型团队第一次触摸到了难能可贵的定价权。

然而,那条曾让海外巨头寝食难安的斩杀线,也在不知不觉间,被它们自己推高了。

闪电战

大洋彼岸在夏天完成了战略调头。

6 月底,Anthropic 发布 Sonnet 5,标出每百万输入 2 美元、输出 10 美元的首发促销价,原本明确声明 9 月将恢复至 3 美元和 15 美元。

而到了 7 月,OpenAI 推出 GPT-5.6 系列,三周后突然发动闪电战,Luna 价格降低 80%,输入端跌至 0.2 美元,输出端降至 1.2 美元。

OpenAI 将这次降价归功于纯粹的底层工程重构,重写的 GPU kernel 将端到端服务成本压低了约 20%,重新训练的投机解码草稿模型令生成吞吐提速 15% 以上。

8 月 10 日,Anthropic 撤回涨价通告,宣布 Sonnet 5 永久锁定低价。

9 月 22 日,Anthropic 掏出 Opus 5.5,综合使用成本下调 40%;同日 OpenAI 推出 GPT-6 Sol 与 Luna,Luna 将入门价锁死在输入 0.1 美元、输出 0.5 美元。随后登场的,便是 Haiku 5.5。

两年前坚信「智能必须享有单独溢价」的 Anthropic,亲手撕掉了自己的标签。

现在大模型发布时的话术也变了。不再是纯粹罗列 MMLU 的微弱胜出,他们开始反复强调单位美元产出、延迟与每一步推理消耗的工程效率。

并且,在 Haiku 5.5 亮相同时,Anthropic 宣布向订阅用户全面配发 API 额度,Max 级别每月赠送 100 至 200 美元,企业 Team 用户最高可享 500 美元抵扣。

这招直切腹地。价目表上的折扣只影响单次调用决策,但一旦客户的代码工程与 Agent 编排完成适配,撬动迁移的壁垒将高如城墙。

美国巨头敢于发起这场价格战,靠的是深不可测的资金池与供应链特权。

Anthropic 的年化营运收入,从 2025 年底的约 90 亿美元,狂飙至今年 7 月底的超 650 亿美元。5 月完成的那笔高达 650 亿美元的融资,直接将其估值推上 9650 亿美元。

在算力层面,Anthropic 于 4 月宣布扩大与 Google、博通的合作,获得多吉瓦级的下一代 TPU 算力容量,预计从 2027 年起陆续上线。

与之对照,智谱年内通过配售及可转债艰难筹集 700 余亿港元,折合美元,不及 Anthropic 单轮弹药的七分之一。

出得起钱的,依然只有超级巨头。

二级市场的清算向来不留情面。

智谱于 1 月 8 日登陆港股,发行价 116.2 港元。春季的算力荒未能阻挡多头的狂热,6 月 22 日其股价冲至 2980 港元,市值一度触碰 1.33 万亿港元天花板。

随后是漫长的下跌。

7 月限售股解禁,两轮配售将定增价从 1588 港元一路砸至 714 港元。7 月 16 日 Kimi K3 登场次日,智谱全天下挫 28.48%。9 月 22 日 Opus 5.5 与 GPT-6 联袂出击,智谱跌幅再度超过 10%。

9 月 25 日,智谱盘中探底至 610.5 港元,总市值缩水至 3000 亿港元附近,自历史高点回撤近八成。

MiniMax 的轨迹同样惨烈。自 1330 港元峰值下坠,解禁当日重挫 17.98%,7 月中旬收于 216 港元。其上半年近六成收入仰赖海外客户,而海外,正是美国巨头降价风暴首当其冲的战场。

估值口径也开始收紧。据媒体转述,杰富瑞在 9 月的研报中,将智谱云业务对应的 2026 年预测年化收入估值倍数,从 50 倍下调至 30 倍,降幅为 40%。

中国模型曾经凭借极致性价比从巨头口中虎口夺食,而如今,这条路在大洋彼岸也走通了。开发者因便宜而来,自然会因更便宜而去。

0.1 美元的幽灵

2006 年 8 月 25 日,Jeff Barr 在墨西哥卡波圣卢卡斯一片燥热的海滩边,敲下了介绍 Amazon EC2 测试版的文章。

在技术说明的末尾,他写下了一个注定载入商业史的数字,开发者租用一台虚拟计算实例,每小时收费 0.1 美元。

其后的故事众人皆知。AWS 在接下来的十余年里主动下调价格逾百次,2014 年仅 S3 存储费率便腰斩 51%。

云计算从未靠着将同等算力越卖越贵来成就霸业。规模、底层自研芯片与极致运维压榨出的每一分边际利润,被源源不断地回馈给终端市场,进而吸引更多开发者。持续降价的 AWS 最终成长为年营收近 1300 亿美元、营业利润率高达 35.4% 的现金奶牛。

价格战,是规模垄断者最后的围剿战术。

今天能够把模型价格压到一折、发布即刻铺满全球三大公有云货架的人,不仅在贩卖 token,更在消化 token。Anthropic 一边血洗 API 价格,一边用庞大的推理算力反哺 Claude Code、Cowork 与自身的端到端 Agent 产品。

中国大模型团队依然没有放下武器。9 月 DeepSeek 再度下调 Flash 系列资费,小米将 MiMo-Flash 推向 1 元/百万 token 的极限,智谱亦将 GLM-5.3-Flash 定价死磕在微利区间。但牌桌上的筹码规则已经改写。

低价本身,已经不再是一张具备排他性的护城河牌。

在那张由 Artificial Analysis 实时更新的散点图上,中国公司的名字一家都没有缺席。GLM、DeepSeek、Kimi、千问、MiniMax 依然都在。

只是,它们现在已经划不出那条斩杀线了。

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
(https://t.me/mytokenGroup)