token 价格通缩、用量爆炸与收入分化:从「卖模型」到「卖产出」的定价迁移
本报告给出三个判断:其一,token 价格进入指数级通缩。Silicon Data 全球 token 支出指数 8 月底跌破 1 美元/百万 token 的历史关口,十周下跌 43%;同等前沿能力价格约为 2023 年初的 12%。其二,降价没有让账单变小。谷歌月处理 token 量两年增长约 330 倍至 3.2 千万亿,中国日均调用量两年增长超千倍至 140 万亿;智能体把单任务消耗放大最高 15 倍,「单位成本下行、总账单上行」同时成立。其三,收入向「单位智能含金量」集中。Anthropic 以约 11% 的 token 份额拿走近 42% 的 OpenRouter 平台收入,年化收入 650 亿美元反超 OpenAI;中国 1—8 月大模型中标金额约 320 亿元、已超 2025 全年——定价权正从「按 token 卖」迁移到「按产出卖」。
衡量这轮通缩最直接的标尺是Silicon Data 的 LLM Token 支出指数(彭博代码 SDLLMTK):该指数按使用量加权追踪全球主流商业模型的实际成交价格。2026 年 5 月底为 2.04 美元/百万 token,7 月底跌至 1.45 美元,8 月初跌破 1.20 美元,8 月 31 日首次击穿 1 美元关口、报 0.97 美元,创指数发布以来最低,距 5 月 28 日 2.07 美元的高点腰斩有余,仅过去 7 天就下跌 8.6%。拉长视角:以同等能力衡量,当前价格约为 2023 年 3 月(GPT-4 级能力上市初期,可比基准可达 30 美元/百万 token)的 12%;若按固定能力(GPT-3.5 级)测算,斯坦福 HAI 口径下两年降幅约 280 倍。
| 时点 | 指数价格(美元/百万 token) | 事件 |
|---|---|---|
| 2026-05-28 | 2.07(年内高点) | 夏季价格战前夜 |
| 2026-05-31 | 2.04 | DeepSeek 宣布 V4-Pro API 永久降价至原价 1/4 |
| 2026-07 下旬 | 1.45 | OpenAI 将两款 GPT-5.6 Luna 降价 80%(输入 0.20/输出 1.20 美元) |
| 2026-08 上旬 | 1.16—1.18 | 十周累计跌幅 43%;中国模型降价持续传导 |
| 2026-08-31 | 0.97(历史新低) | 首破 1 美元关口,7 天跌 8.6% |
21 世纪经济报道在指数破位后采访多位业内人士,把中国模型的低价归纳为「三拳组合」,本报告认为这同样构成全球 token 通缩的一般框架:
| 推力 | 机制 | 代表证据 |
|---|---|---|
| 架构层 | 混合专家(MoE)只激活部分参数,配合注意力优化与自研推理引擎,从源头压低单次调用算力消耗 | DeepSeek、月之暗面等主流开源模型普遍采用;同代智能水平推理成本大幅压缩 |
| 定价机制层 | 缓存分层与动态定价,把高频调用的边际成本打穿 | DeepSeek V4-Pro 缓存命中输入价低至 0.025 元/百万 token,创全球大模型价格新低 |
| 开源战略层 | 权重开放使 API 失去溢价空间,私有化部署的边际成本约等于算力 | OpenRouter 数据:中国模型 token 份额从 2024 年底不足 2% 升至 2026 年中逾 50% |
价格追踪机构 TokenMix 的横截面数据与此互为印证:在 MMLU 得分高于 85% 的模型中,每百万输出 token 的中位价格从 2024 年 1 月的 25 美元降至 2026 年 4 月的 2.80 美元,降幅 89%——同等智能的价格标签在一个经济周期内被抹掉一个数量级。
价格指数跌势凌厉,但没有任何一家主流平台的 AI 收入随之下降——原因在分母。谷歌在 2026 年 I/O 大会(5 月 20 日)给出的官方口径是:月处理 token 量从两年前的 9.7 万亿、增长到去年的 480 万亿、再跃升至今年的 3.2 千万亿(quadrillion),同比 7 倍、两年约 330 倍;同期 850 万开发者每月使用其模型构建应用,模型 API 每分钟处理约 190 亿 token,过去 12 个月有 375 家以上 Google Cloud 客户各自处理超过 1 万亿 token。
| 平台/口径 | 数据 | 时点 | 来源 |
|---|---|---|---|
| 谷歌(全量口径) | 月处理 9.7 万亿 → 480 万亿 → 3.2 千万亿 token | 2024-05 → 2025-05 → 2026-05 | Google I/O 官方演讲 |
| 微软 | 季度处理超 100 万亿 token(同比 +5 倍),3 月单月 50 万亿 | FY26Q3 财报电话会 | 微软财报电话会 |
| OpenRouter(中立聚合) | 周调用量 5 万亿 → 25 万亿 token(半年 5 倍) | 2026-05 | I/O Fund 引平台数据 |
| OpenClaw(开源智能体框架) | token 消耗 806 亿 → 3580 亿/日(一个月 3.4 倍) | 2026-02 → 2026-03 | OpenRouter 数据,南方+ 转引 |
| Fireworks AI(推理平台) | 日处理 40 万亿 token(三个月翻倍) | 2026-07 | I/O Fund |
| 中国(全国口径) | 日均 1000 亿 → 140 万亿 token(两年增长超千倍) | 2024 年初 → 2026-03 | 中国信通院 |
中国市场给出了同样的斜率。中国信通院副院长魏亮 7 月披露:我国日均 token 调用量已从 2024 年初的约 1000 亿飙升至 2026 年 3 月底的 140 万亿;信通院监测另显示 2025 年中国公有云企业级 token 调用量达 2000 万亿,较 2024 年(IDC 口径 114 万亿)增长超 16 倍,IDC 数据显示 2025 年中国企业级 MaaS 市场 token 调用量 1944 万亿、公有云 MaaS 市场收入 30.7 亿元。中国电信研究院《智能体时代 AI 基础设施发展研究报告(2026)》预计:2026 年中国全年 token 消耗约 1 亿亿(10^17),2030 年超过 3.5×10^19;到 2029 年,推理算力将占中国算力需求的 80%。
放大器是智能体。Anthropic 的测算被业内广泛引用:多智能体系统单任务的 token 消耗最高可达普通聊天交互的 15 倍;OpenRouter 上智能体流量自 2026 年 2 月起已超过人类聊天流量。高盛(2026 年 5 月)预测 2026—2030 年全球 token 消耗增长 24 倍,到 2030 年智能体类工作负载约占 AI 工作量的 84%。Palo Alto Networks CEO Nikesh Arora 的判断则指向终点:token 单价还需再降约 90%,才能真正解锁大规模企业级采用——这是一轮典型的 Jevons 效应。
价格通缩没有消灭利润,但剧烈地重新分配了它。年化收入(run-rate)口径下,Anthropic 从 2025 年底的约 90 亿美元一路升至 2026 年 4 月的 300 亿(当月反超 OpenAI)、5 月末 470 亿、7 月末 650 亿美元;其 Q2 收入 115 亿美元,并录得成立以来首个正的调整后经营利润,管理层指引年底年化收入达 1000 亿—1200 亿美元。OpenAI 则从 2025 年底的约 200 亿美元升至 8 月的 400 亿美元——增速依然可观,但绝对差距拉大到 250 亿美元。
| 维度 | OpenAI | Anthropic |
|---|---|---|
| 年化收入 | 约 400 亿美元(2026-08) | 约 650 亿美元(2026-07 末) |
| 收入结构 | 订阅约 70%;企业 + API 合计已过半 | API/企业客户约 80% |
| 分发优势 | 约 9 亿周活消费者入口;付费订阅 5000 万+ | 企业 LLM API 支出份额约 40%(Menlo Ventures,OpenAI 约 27%) |
| 旗舰产品 | Pro 订阅(200 美元/月);广告业务 200 天做到 10 亿美元年化 | Claude Code 年化收入 25 亿美元(2026-02,四个月前为 10 亿) |
| 成本与利润 | 毛利率约 33%;推理成本 2025 年 84 亿 → 2026 年预计 141 亿美元(Sacra 估计) | Q2 首次录得正调整后经营利润 |
OpenRouter 的平台数据揭示了分化背后的定价机制:Anthropic 以约 11% 的 token 份额拿走了约 42% 的平台收入——其 Opus 级模型输出定价 25—30 美元/百万 token,与 DeepSeek Flash 的 0.09—0.18 美元之间存在两个数量级的价差,且至今没有收敛。与此同时,低价侧在放量:输入价低于 1 美元/百万 token 的模型请求占比从 1 月的 18% 升至 6 月的 41%。市场正在分裂为「按智能含金量定价的高端层」与「按算力成本定价的量产层」,两个层级同时增长。
中国市场的采购侧数据提供了一个与海外订阅/收入口径互补的观察窗。云行业机构智能超参数的监测显示:2026 年 1—8 月,大模型相关中标项目达 7322 个、披露中标金额约 320 亿元,两项指标已全面超越 2025 年全年;上半年中标项目数量同比增长超 130%、披露金额同比增长近 300%。分季度看,一季度全行业公开中标 1632 个项目、总金额 76.8 亿元,同比增速均超 200%。行业结构上,金融行业上半年大模型中标项目 406 个、同比增长 110%;月度中标数量上科大讯飞保持领先,8 月厂商梯队依次为科大讯飞、阿里云、腾讯云、火山引擎、百度与智谱。
| 期间 | 项目数 | 披露金额 | 同比 | 来源 |
|---|---|---|---|---|
| 2026 Q1(全行业) | 1632 个 | 76.8 亿元 | 项目与金额增速均超 200% | 智能超参数(科创板日报转引) |
| 2026 H1(全行业) | — | — | 项目数 +130%、金额 +300% | 智能超参数 |
| 2026 H1(金融) | 406 个 | — | +110% | 智能超参数 |
| 2026 年 1—8 月(全行业) | 7322 个 | 约 320 亿元 | 已超 2025 全年 | 智能超参数(2026-09-15) |
云厂商结构同步印证「从买零件到买成品」的迁移:上半年五家主要 AI 云厂商披露的大模型相关中标金额约 20.44 亿元,百度智能云以 13.85 亿元、47 个项目居首(占五家合计近六成),第二名 55 个项目、3.13 亿元,第三名 45 个项目、1.71 亿元。百度智能云项目集中于金融、政务、大交通与具身智能,客户包括中国联通、中国银联等头部机构。百度集团执行副总裁沈抖的表述颇具代表性:智能体时代「AI 云竞争的核心不是比谁消耗了更多 token,而是比谁能用好每一个 token」——客户的采购清单关键词已从「模型接口」切换为「智能体、行业应用、端到端」。
运营商则把 token 变成了面向公众的「话费」:中国移动 5 月在全国上线 Token 套餐(5 元月包起步),统一算力量纲封装不同模型的 token 消耗,其 Token 运营生态已接入 300 余款模型,通过集约化运营使单位 token 成本下降约 30%;8 月中期业绩会上进一步宣布将推出全国统一的 Token 套餐资费。
综合前三章的数据,经营者面对的其实是一个由三条曲线叠加的格局:单价曲线指数下行、用量曲线指数上行、收入曲线向头部集中。据此本报告给出三个判断与对应动作。
| 判断 | 数据依据 | 对企业的动作 |
|---|---|---|
| ① token 通缩是确定性趋势,但总账单上涨 | 同等能力价格两年降约 280 倍(Stanford HAI);智能体单任务消耗最高 15 倍(Anthropic) | 预算从「按席位订阅」改为「订阅 + token 预算」双轨制,按项目核算用量 |
| ② 路由与缓存成为显学 | 输入价低于 1 美元的请求占比 18% → 41%(OpenRouter,1—6 月);DeepSeek 缓存命中价 0.025 元/百万 token | 建立分层路由:便宜模型做量、旗舰模型做决策;高频固定上下文全部走缓存 |
| ③ 付费标的从 token 转向产出 | Anthropic 以 11% token 份额收 42% 收入;中国中标金额超 2025 全年且智能体/应用类占比上行 | 对外采购合同按交付结果验收;对内把「智能体产出」纳入部门 KPI 计量 |
落到 AICOR 的内核视角:token 经济的本质是把「智能」变成了可计量、可调度、可定价的公用事业资源——这与电力进入工厂时的产业含义同构。单位成本每降一半,值得自动化的流程边界就外扩一圈;谁能把流程拆得更细、把任务定义得更可测量,谁就能把通缩红利装进自己的口袋,而不是让它在「人还是按老方式干活」中蒸发。