轻量化迁移、定价层谱、一体机第二战场、组合采购新范式——大模型市场结构变迁全景拆解。
2026 年大模型市场的结构正被「轻量化」改写。OpenRouter 数据显示,9 月中旬全球大模型周调用量达 129 万亿 token,中国模型达 67.46 万亿、为美国的 4.7 倍、连续 21 周全球第一;更关键的是调用结构——DeepSeek V4 Flash、V4.1 Flash、腾讯混元 Hy4、智谱 GLM-5.3 Flash 四款轻量模型周调用量全部突破 10 万亿,合计约占中国模型份额的 66%。定价层同步拉开 32 倍价差:每百万 token 从小米 MiMo-V2.5 的 1.25 元到 Kimi K3 的 40 元。瑞银测算中国模型 API 定价约为海外同级的 10%-20%、毛利仍达 20%-40%,约 60% 的企业已为 token 开支设限。企业采购正从「单旗舰订阅」走向「旗舰+轻量」的组合分层。
调用量的全球格局在 9 月继续强化。据《每日经济新闻》基于 OpenRouter 数据的测算,9 月 14-20 日当周全球大模型总调用量达 129 万亿 token, 其中中国模型 67.46 万亿(环比 +10.28%)、美国模型 14.21 万亿(环比 -34.7%)——中国调用规模达美国的 4.7 倍,且已连续 21 周位居全球第一。 头部座次由轻量模型包办:DeepSeek V4.1-Flash 以 15.8 万亿 token(环比 +219%)升至全球第一,智谱 GLM 5.3 Flash(14.1 万亿)、 腾讯混元 Hy4 preview(12.5 万亿)分列二三位,DeepSeek V4 Flash 正式版以 9.44 万亿位列第五——全球前五中四席属于中国轻量模型。
智库侧的周度追踪印证了同一结构。智能经济 30 人论坛 AGI 测评中心《AGI 市场观察》(9 月 12-18 日当周)显示:周调用量突破 10 万亿 token 的 四款模型全部为轻量级(Flash/类 Flash)——DeepSeek V4 Flash(14.59 万亿)、DeepSeek V4.1 Flash(12.93 万亿)、混元 Hy4 preview(12.01 万亿)、 GLM 5.3 Flash(11.62 万亿);四款模型在中国大模型词元用量中的份额分别为 18.88%、16.73%、15.54% 与 15.04%,合计约 66%, 前五位合计超过四分之三。价格杠杆的作用立竿见影:DeepSeek 于 9 月 10 日下调 V4.1 Flash 定价后,该模型周调用量环比暴增 483.62%、 位次从第 9 跃升至第 2;其上线不到 24 小时即处理约 1 万亿 token。一年之前,OpenRouter 调用量前十中中国模型仅占 2 席、份额不足 20%—— 如今前十中中国已占 7 席、整体份额超 45%。
| 指标 | 数值 | 说明 |
|---|---|---|
| 全球周调用量(9/14-20) | 129 万亿 token | OpenRouter 口径,环比口径见各家测算 |
| 中国 vs 美国 | 67.46 万亿 vs 14.21 万亿(4.7 倍) | 中国连续 21 周全球第一(每日经济新闻测算) |
| 周调用破 10 万亿的模型 | 4 款,全部为 Flash/类 Flash 轻量模型 | AGI 测评中心《AGI 市场观察》(9/12-18) |
| 中国四强份额合计 | 约 66%(前五位超 75%) | V4 Flash 18.88%/V4.1 Flash 16.73%/Hy4 15.54%/GLM 15.04% |
| 降价弹性 | V4.1 Flash 降价后周调用 +483.62% | 9 月 10 日调价,位次第 9→第 2 |
| 一年格局变化 | 前十中中国 2 席/份额<20% → 7 席/份额超 45% | OpenRouter 口径(2025.09 → 2026.09) |
轻量化分层的另一面是定价带宽的急剧拉宽。AGI 测评中心对 Top15 中国大模型的追踪显示,每百万 token 最高价与最低价相差 38.75 元: 最低为小米 MiMo-V2.5 的 1.25 元,最高为月之暗面 Kimi K3 的 40 元——同一张榜单上并存着 32 倍的价格差,且两者都活得好好的。 横向对比海外,中国信息通信研究院副院长敖立在 9 月 21 日北京互联网大会上给出的口径是:输入定价方面 Kimi-2.5 约为 Claude Opus-4.6 的 六分之一,输出定价方面 MiniMax M2.5 约为海外模型的十分之一至二十分之一。瑞银证券的测算更系统:中国模型 API 定价约为海外对标模型 平均定价的 10%-20%,且仍能保持 20%-40% 的毛利水平。
需求侧的约束同样明确:瑞银报告显示,约 60% 的企业已为 token 开支设置上限。预算封顶改变了采购逻辑——企业开始用「基准任务成本」 而非「token 单价」比价:AGI 测评中心按统一基准任务折算,腾讯 Hy3 的单任务成本低至 0.308 元,与 DeepSeek V4.1 Flash、MiniMax M3、 GLM 5.3 Flash 同处「经济好用」区间。这解释了一个表面矛盾:Kimi K3 卖 40 元/百万 token 的旗舰价,与 MiMo-V2.5 卖 1.25 元的轻量价, 面向的其实是预算表上不同的科目——前者买的是高价值任务的确定性,后者买的是长尾任务的规模经济。
| 层级 | 代表模型与定价 | 对应负载 | 采购逻辑 |
|---|---|---|---|
| 轻量层(Flash/类 Flash) | 小米 MiMo-V2.5:1.25 元/百万 token(Top15 最低) | 问答、摘要、检索、工单等高频长尾 | 按基准任务成本比价,预算敏感 |
| 经济层 | 腾讯 Hy3:单基准任务 0.308 元;DeepSeek V4.1 Flash、MiniMax M3、GLM 5.3 Flash 同区间 | 常规生产任务 | 性价比+稳定性平衡 |
| 旗舰层 | 月之暗面 Kimi K3:40 元/百万 token(Top15 最高) | 高价值高风险任务 | 为确定性付溢价,用量可控 |
| 中外价差 | 中国模型 API 定价约为海外对标的 10%-20% | 整体市场 | 瑞银:毛利仍达 20%-40% |
| 预算约束 | 约 60% 企业已为 token 开支设限 | 企业侧 | 瑞银证券口径 |
当舆论聚焦 API 价格战时,市场同时在另一条曲线上放量——私有化部署的大模型一体机。中国信通院与浙商证券的口径显示:2025 年中国大模型 一体机市场规模 1,236 亿元、出货约 15 万台;2026 年预计跃升至 2,937 亿元、出货 39 万台(同比 +137.6%);2027 年有望进一步突破 5,208 亿元、 出货 72 万台。驱动力是合规而非价格:公安、金融、医疗、政务等数据敏感行业受合规约束无法将核心数据上公有云,一体机成为「数据不出域」的 最优解,2026 年整机国产化率已普遍超过 80%。需求结构上,政务与公安占 38%、金融与能源占 27%、制造与医疗占 19%。价值重心也在迁移—— 中标金额高企的项目多为「服务+持续运营」性质,产业价值正从「卖盒子」走向「卖能力」。
| 年度 | 市场规模 | 出货量 | 关键特征 |
|---|---|---|---|
| 2025 年 | 1,236 亿元 | 约 15 万台 | 从实验室产品到工业化落地的跨越 |
| 2026 年(预测) | 2,937 亿元(+137.6%) | 约 39 万台 | 国产化率超 80%;合规驱动,数据不出域 |
| 2027 年(预测) | 5,208 亿元 | 约 72 万台 | 两年复合增速约 110%;从卖盒子到卖能力 |
公开招投标数据勾勒了政企大模型采购的真实座次。据行业媒体对公开中标信息的统计,科大讯飞 2025 年全年大模型相关项目中标金额达 23.16 亿元、 超过第二名至第六名的总和,2026 年上半年中标数量与金额继续位居全行业第一;其交付模式以「从芯片到应用」的全栈国产化方案为标签, 山东肥城的县域级 50P 国产化智算中心项目将算力费用较传统模式降低约 40%。云厂商侧,2025 年中国主流云厂商大模型相关项目累计中标 341 个、 总金额约 27 亿元,百度智能云以 109 个项目、约 9 亿元拿下数量与金额双第一,2026 年上半年公开披露中标金额已达 13.85 亿元; 更值得注意的结构信号是:2026 年上半年应用类项目已占公开中标大模型项目的近一半,采购需求正从「知识问答、办公助手」升级为 「智能审核与分析决策」。渠道侧,三大运营商扮演「超级入口」:中国移动 2026 年上半年算力服务收入已达 529 亿元,并联合科大讯飞等启动 Token 运营生态联盟;中国电信星辰 TokenHub 汇聚 142 个大模型、开发 420 余个行业智能体;中国联通元景 MaaS 平台汇聚超 230 个全模态大模型。
| 玩家 | 2025 年成绩 | 2026 年进展 | 定位 |
|---|---|---|---|
| 科大讯飞 | 中标 23.16 亿元,超 2-6 名总和 | 上半年数量与金额双第一 | 全栈国产化方案商 |
| 百度智能云 | 109 个项目/约 9 亿元,云厂商双第一 | 上半年中标 13.85 亿元;Agent 中标数量连续两年居首 | 智能体规模化交付 |
| 中国移动 | —— | 上半年算力服务收入 529 亿元;Token 运营生态联盟 | 渠道+算力入口 |
| 中国电信 | —— | 星辰 TokenHub 汇聚 142 个大模型、420+ 行业智能体 | 模型聚合分发 |
| 中国联通 | —— | 元景 MaaS 汇聚 230+ 全模态大模型 | 算力+数据+模型三位一体 |
调用量的领先正在转化为真实的商业渗透。据世界互联网大会官网综述(参考人民日报、界面新闻等报道),DoorDash、Airbnb 等企业与多家欧洲 头部车企已开始采用中国大模型优化业务流程;AWS、微软 Azure 等全球云平台均已接入多款中国模型;新加坡、马来西亚等国基于中国开源模型 构建本土主权 AI;非洲初创企业采用中国开源模型后成本最高可降九成。信通院副院长敖立将「Token 出海」定义为中国 AI 推理能力以数据要素 形式的跨境输出——其背后是能源供给、数据与场景、工程迭代速度的综合优势。竞争维度随之切换:当调用规模与价格优势已确立, 下半场的分水岭是企业级交付能力——谁能把调用量变成留存与利润。
企业侧的采购结构正在发生根本变化:从「单旗舰订阅」走向「组合采购」。逻辑链条是——60% 的企业给 token 开支封顶(瑞银), 封顶之后必然分层;分层之后必然多供应商:旗舰层保留一家最强模型处理高价值任务,轻量层在 Flash 模型池中按基准任务成本动态比价。 这正是四款轻量模型周调用齐破 10 万亿的企业侧注脚。投研机构 Macrostream 的企业侧追踪亦显示,中国企业日均 token 消耗份额中阿里云升至 约 32%、豆包约 21.3%、DeepSeek 约 18.4%(投研口径,供方向性参考)——头部集中与多供应商并存同时成立,印证「组合」而非「单选」。
| 采购要素 | 旧范式(2024-2025) | 新范式(2026) |
|---|---|---|
| 模型选择 | 单旗舰订阅,绑定单一厂商 | 旗舰+轻量组合,多供应商并存 |
| 比价指标 | 每百万 token 单价 | 每完成一个标准任务的成本 |
| 预算约束 | 按用量自然增长 | 60% 企业设置 token 开支上限 |
| 部署形态 | 公有云 API 为主 | API 与一体机并行(一体机 2026 年预计 2,937 亿元) |
| 采购入口 | 直接对接模型厂商 | 云厂商与运营商渠道占比上升(移动算力收入 529 亿元) |