推理支出首次超过训练,模型定价进入“K 型分化”:底层智能趋于廉价,高价值任务持续溢价
2026 年,全球 AI 支出预计突破 2.52 万亿美元(Gartner),其中 AI 软件支出达 4,524 亿美元,同比增长 60%。更值得关注的是,推理支出首次超过训练支出:Gartner 预测 2026 年企业推理基础设施支出达 233 亿美元,而训练为 190 亿美元。这意味着大模型产业的价值锚点,正从“谁能训练出更大模型”转向“谁能以更低成本把模型跑进生产环境”。
与此同时,Token 价格在过去六年下跌约 98%(GPT-3 Davinci $60/MTok → GPT-4o Mini $0.15/MTok),但企业 AI 推理预算在 2024—2026 年间却增长了 483%(FinOps Foundation)。其背后的核心矛盾是:单位智能成本在下降,但 Agent 化工作流把单次用户请求扩展为几十到上百次模型调用,总成本反而随使用深度上升。对企业而言,选型重点已从“哪个模型最强”转向“如何按任务价值分层调用模型”。
根据 Gartner 2026 年 1 月发布的全球 AI 支出预测,2026 年全球 AI 总支出将达到 2.52 万亿美元,较 2025 年的 1.76 万亿美元增长 44%;到 2027 年将进一步攀升至 3.34 万亿美元。其中,AI 基础设施仍是最大单一品类(1.37 万亿美元),但 AI 软件支出增速最快:从 2025 年的 2,831 亿美元增至 2026 年的 4,525 亿美元,增幅达 60%。
AI 模型与平台支出是软件中的高亮板块。Gartner 预测 2026 年全球企业在 AI 模型与平台上的支出将达 640 亿美元,同比增长 63.4%。基础生成式 AI 模型收入预计从 2025 年的 114 亿美元增至 2026 年的 234 亿美元(+104%);而增长最快的是领域专用模型(DSLM),从 16 亿美元暴增至 49 亿美元(+210%),反映出企业不再满足于通用对话模型,而是需要适配行业知识、合规要求与内部流程的专属模型。
| 细分品类 | 2025 年(十亿美元) | 2026 年(十亿美元) | 2027 年(十亿美元) | 2026 同比增速 |
|---|---|---|---|---|
| AI 基础设施 | 964.96 | 1,366.36 | 1,748.21 | +41.6% |
| AI 服务 | 439.44 | 588.65 | 761.04 | +34.0% |
| AI 软件 | 283.14 | 452.46 | 636.15 | +59.8% |
| AI 网络安全 | 25.92 | 51.35 | 86.00 | +98.1% |
| AI 模型 | 14.42 | 26.38 | 43.45 | +82.9% |
| 数据科学与机器学习平台 | 21.87 | 31.12 | 44.48 | +42.3% |
| AI 应用开发平台 | 6.59 | 8.42 | 10.92 | +27.6% |
| AI 数据 | 0.83 | 3.12 | 6.44 | +277% |
数据来源:Gartner Forecast: AI Spending, Worldwide, 2024-2029, 4Q25(2026-01)
2026 年是大模型产业成本结构的拐点年。Gartner 预测,AI 优化基础设施支出中,推理工作负载占比将在 2026 年达到 55%,首次超过训练;到 2029 年这一比例将超过 65%。这一转变对企业 IT 预算的直接影响是:AI 成本从“可预测的一次性资本开支”变成“随使用量线性增长的运营开支”。
过去两年,大模型定价经历了剧烈压缩。OpenAI GPT-3 在 2020 年的输入定价约为 $60/MTok;到 2024 年 GPT-4o Mini 仅 $0.15/MTok,同等能力价格下降约 400 倍。2025 年 GPT-5 发布时输入价进一步降至 $1.25/MTok,2026 年 OpenAI GPT-5.6 系列则将中档模型 Terra 定价为 $2/MTok 输入、$12/MTok 输出,经济型 Luna 低至 $0.20/$1.20。
但“普遍降价”只是故事的一半。2026 年夏季以来,行业出现明显分化:OpenAI 把 Luna 降价 80% 以承接大规模 Agent 执行负载,却把 GPT-5.6 Sol 的 Fast 模式涨至 2 倍价格;DeepSeek V4 Pro 在高峰时段输入价从 ¥3/M 调至 ¥9/M、输出从 ¥6/M 调至 ¥27/M;Kimi K3 发布即定位高端,输入约 ¥20/M、输出约 ¥100/M。这种分化说明:低端通用推理正在基础设施化,而高端推理、低延迟访问与复杂 Agent 规划仍在收取显著溢价。
| 厂商 | 模型 | 输入(美元) | 输出(美元) | 定位 |
|---|---|---|---|---|
| Anthropic | Claude Fable 5.1 | $10.00 | $50.00 | 顶级推理 |
| OpenAI | GPT-5.6 Sol | $4.00 | $20.00 | 旗舰 |
| Anthropic | Claude Opus 5 | $5.00 | $25.00 | 旗舰 |
| OpenAI | GPT-5.6 Terra | $2.00 | $12.00 | 中档 |
| Anthropic | Claude Sonnet 5 | $2.00 | $10.00 | 中档 |
| Gemini 3.1 Pro | $2.00 | $12.00 | 中档 | |
| DeepSeek | V4 Pro(闲时) | ~$0.93 | ~$1.88 | 高性价比 |
| DeepSeek | V4 Flash(闲时) | ~$0.31 | ~$0.63 | 经济型 |
| OpenAI | GPT-5.6 Luna | $0.20 | $1.20 | 超经济型 |
| Z.AI | GLM-5.3-Flash | $0.15 | $0.50 | 轻量任务 |
注:汇率按 1 USD ≈ 7.2 CNY 估算;DeepSeek 价格为闲时价。数据来源:各厂商官方 API 定价页(2026-07—08)
2025—2026 年上半年,DeepSeek、Qwen、豆包、GLM 等国产模型凭借极低定价快速占领开发者心智。但 2026 年下半年起,两条线索显示这一窗口在收紧:一是 DeepSeek 等厂商开始上调 API 价格并引入峰谷定价,测试需求弹性;二是高端模型(如 Kimi K3)选择直接定高价,走“开放权重+高溢价托管 API”的双轨路线。这意味着国产模型也在从“统一低价获客”走向“按任务价值分层定价”。
Menlo Ventures《2025 年企业生成式 AI 现状》调查显示,在企业 LLM 支出份额上,Anthropic 从 2023 年的 12% 跃升至 2025 年的 40%,而 OpenAI 从 50% 降至 27%。这一变化不能简单理解为“Anthropic 赢了 OpenAI”,而是企业采购行为成熟化的结果:当模型能力差距缩小,买家更看重成本可控、安全合规与长期服务稳定性。
与此同时,企业的“自建替代购买”倾向在增强。McKinsey《2026 年 AI 现状》报告指出,32% 的企业因为可以用 AI 编程工具自建功能而放弃购买至少一款外部软件;在科技行业这一比例高达 41%。这对 SaaS 厂商和 AI 应用创业者构成直接威胁:如果产品价值仅停留在“套壳调用大模型”,企业客户很可能选择自己做一个内部版。
| 厂商 | 2023 年企业 LLM 支出份额 | 2025 年企业 LLM 支出份额 | 变化 |
|---|---|---|---|
| OpenAI | ~50% | 27% | -23 pct |
| Anthropic | 12% | 40% | +28 pct |
| 其他(Google、开源、国产等) | ~38% | ~33% | -5 pct |
数据来源:Menlo Ventures, State of Generative AI in the Enterprise, 2025
McKinsey 2026 年调研显示,80% 的员工认为 AI 提升了个人生产力,但只有 37% 的企业报告 AI 对 EBIT 有正向贡献;同时 20% 的企业因为运营成本(包括 Token 成本)限制了 AI 使用。这说明企业面临的不是“模型不够强”,而是“模型用得起但管不住”。
解决这一问题的核心,是把成本管理单位从“每百万 Token”升级到“每次完成任务”。具体抓手包括:
| 优化手段 | 典型节省幅度 | 适用场景 | 实施复杂度 |
|---|---|---|---|
| 模型路由 | 50—80% | 混合复杂度任务 | 中 |
| 提示缓存 | 50—90%(缓存命中部分) | 长系统提示、知识库 | 低 |
| 批处理 API | 50% | 异步生成、评估 | 低 |
| 领域专用小模型 | 70—90% | 固定格式、规则明确任务 | 高 |
| 输出长度与重试控制 | 20—40% | 所有 Agent 场景 | 中 |
整理自 Gartner、McKinsey、OpenAI/Anthropic/DeepSeek 官方文档及 FinOps Foundation 公开研究
本报告数据主要来源于以下公开渠道,所有关键数据均标注来源机构与发布时间:
估计值声明:部分厂商价格因峰谷、批量折扣、缓存命中等因素存在浮动,表格中的人民币价格按 1 USD ≈ 7.2 CNY 估算;实际签约价格可能因企业规模、云厂商通道、预付费承诺而有显著差异。