从性能平权到商业分层:开源模型如何重写企业 AI 采购与部署逻辑
2026 年开源模型生态正经历双重跃迁:能力上,开源/开放权重模型与闭源前沿模型的性能差距在多数生产任务中已收敛到可忽略区间;商业上,开源正在告别「完全免费」时代,走向「基座开放 + 商业分层 + 收入分成」的混合模式。三个判断重塑企业 AI 采购:
判断一:中国开源模型已成为全球生态最大变量。据 Hugging Face 2026 春季报告,中国开源模型下载量占比达 41%,首次超过美国;OpenRouter 2026 年 7 月周数据显示,中国模型 Token 份额约 61%,DeepSeek、Qwen、GLM、MiniMax 等包揽调用前列。
判断二:价格不是营销手段,而是架构决策因素。DeepSeek V4 Flash 输入价低至 0.14 美元/百万 Token,与 Claude Opus 4.6 差距可达数十倍。当 Agent 工作负载单次请求消耗是人类使用的 15 倍时,单位 Token 成本直接决定 AI 员工的经济可行性。
判断三:开源 ≠ 免费,许可证成为新的商业边界。月之暗面 Kimi K3、阿里 Qwen3.8-Max 开始对年销售额超 2000 万美元/5000 万美元的商业用户收取收入分成;DeepSeek、智谱 GLM 则坚持 MIT 等宽松许可——开源生态内部出现「云厂商保护派」与「纯开放派」的分化。
OpenRouter 是全球最大的 AI 模型 API 路由平台,其周度 Token 榜单被视为开发者真实调用需求的「算力晴雨表」。《每日经济新闻》基于 OpenRouter 数据的测算显示,2026 年 7 月 6 日至 12 日当周,全球总调用量 54.6 万亿 Token,中国模型调用量 27.58 万亿 Token,占比约 61%;全球调用量排名前六全部为中国模型。DeepSeek-V4-Flash 以 5.22 万亿周调用量位居前列,小米 MiMo-V2.5、腾讯 Hy3、MiniMax M3、智谱 GLM-5.2 紧随其后。
与此对应,美国模型份额从一年前约 70% 骤降至约 35%。Meta 凭借 Llama 曾定义开源 AI,如今在 OpenRouter 路由量中已跌破 1%;OpenAI 路由份额也降至个位数。这并不意味着闭源厂商收入崩塌——Anthropic 仍凭借高溢价捕获平台约半数收入——但说明高频、commoditized 任务正在大规模流向开源模型。
| 排名 | 模型 | 周调用量(万亿 Token) | 厂商/地区 | 许可 |
|---|---|---|---|---|
| 1 | 腾讯 Hy3 (free) | 6.13 | 腾讯/中国 | 限时免费 |
| 2 | 小米 MiMo-V2.5 | 5.95 | 小米/中国 | 开源 |
| 3 | DeepSeek-V4-Flash | 5.22 | DeepSeek/中国 | MIT |
| 4 | MiniMax M3 | 4.26 | MiniMax/中国 | 自定义 |
| 5 | 智谱 GLM-5.2 | 3.19 | 智谱 AI/中国 | MIT |
| — | Anthropic Claude Opus 4.6 | ~1.9 | Anthropic/美国 | 闭源 API |
Hugging Face 是全球最大的开源模型托管平台,模型数量已超 300 万。据《Hugging Face 2026 春季全球开源 AI 生态报告》(转引自中国工信新闻网、上观新闻),中国开源模型下载占比达 41%,首次超过美国;中国开发者贡献的开源 AI 模型下载量占比达 17.1%,亦高于美国的 15.8%。阿里云披露,其 Qwen 系列自 2023 年开源至今已累计开源 460 余个模型,衍生模型数超 30 万个,累计下载量突破 30 亿次。
中国开源模型密集上新是下载量东移的直接推手:2026 年 2 月阿里 Qwen 3、4 月 DeepSeek-V4、7 月月之暗面 Kimi K3、8 月阿里 Qwen3.8-Max 与 Qwen3.8-27B 等相继开源。Qwen3.8-27B 开源两日全球下载量即破百万,Hugging Face 趋势榜连续多日登顶。
开源模型对闭源模型的冲击首先体现在价格。DeepSeek V4 Flash 输入价低至 0.14 美元/百万 Token、输出价 0.28 美元;而 Claude Opus 4.6 公开定价为输入 5 美元/百万 Token、输出 25 美元——输入端差距约 36 倍,输出端差距约 90 倍。CNBC 实测显示,用 Claude 跑一轮基准评估约需 4811 美元,用智谱 GLM 跑同样任务只需 544 美元,价差约 9 倍。
这种价格剪刀差不是简单的「补贴抢市场」,而是三重结构性因素叠加:中国工业用电成本比美国低 30%–40%,中西部绿电甚至低 50%–70%;自 2024 年芯片限制以来中国厂商被迫压榨现有硬件效率,工程优化能力被「逼」出来;Mixture-of-Experts(MoE)架构只激活部分专家网络,处理简单任务时大幅降低算力消耗。
| 模型 | 输入价($/百万 Token) | 输出价($/百万 Token) | 相对 Claude Opus 输入成本 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | ~1/36 |
| 小米 MiMo-V2.5 | $0.105 | $0.28 | ~1/48 |
| 智谱 GLM-5 | $0.30 | $2.55 | ~1/17 |
| MiniMax M2.5 | $0.30 | $1.10 | ~1/17 |
| Claude Opus 4.6 | $5.00 | $25.00 | 1x |
| GPT-5.5 | $5.00 | $30.00 | 1x |
OpenRouter 数据显示,AI 使用重心正从闲聊、角色扮演转向编码与 Agent 工作流:编程类工作负载占比从 2025 年初约 11% 升至 2026 年中超过 50%。Agent 工作负载单次请求的 Token 消耗约为人类正常使用的 15 倍。这意味着,一个每天处理 500 万 Token 的研究型 Agent,使用 Claude 每天成本约 125 美元,而使用 DeepSeek V3.2 仅约 0.70 美元。成本优化的不是「可选项」,而是决定 Agent 能否规模化部署的「必选项」。
2026 年,中国开源大模型阵营出现明显分裂。据 36Kr 调查(转引自 Brocker 等机构),阿里巴巴 Qwen3.8-Max 和月之暗面 Kimi K3 引入了商业使用门槛:对年销售额超过 5000 万美元(Qwen)或 2000 万美元(Kimi K3)的商业用户,要求签订单独商业协议,收入分成比例最高可达 30%,并明确限制第三方基于其模型提供 MaaS 或 AI 工作助手平台。其目的在于防止竞争对手云厂商(字节跳动火山引擎、百度云、腾讯云)无偿利用其开源权重搭建托管服务。
另一边,DeepSeek 重申 MIT 许可承诺,智谱 GLM-5.3-Flash 也采用 MIT 许可,不设置营收门槛。这种分化揭示开源模型商业化的真实路径:头部云厂商把开源模型作为云生态获客与锁客工具,独立实验室则把宽松许可作为获取开发者与生态份额的武器。
| 模型/厂商 | 主要许可 | 商业门槛 | 模式定位 |
|---|---|---|---|
| DeepSeek V4 系列 | MIT | 无营收门槛 | 纯开放,以生态份额换云/API 收入 |
| 智谱 GLM-5.x | MIT | 无营收门槛 | 纯开放,强化开发者生态 |
| 阿里 Qwen3.8-Max | Qwen Community License | 年收入超 $5000 万需签商业协议 | 保护阿里云托管收入 |
| 月之暗面 Kimi K3 | 自定义商业许可 | 年收入超 $2000 万需分成,最高 30% | 保护 API 与生态收入 |
| Meta Llama 4 | Llama Community License | MAU 超 7 亿需单独许可;欧盟用户/企业除外 | 生态基座 + 上层闭源商业化 |
截至 2026 年 8 月,开源模型跑通的变现路径主要有五条:高营收大客户收入分成、云托管算力配套付费、高级 API 与增值功能收费、垂直场景定制服务、企业级技术支持订阅。其中 API 与云托管是目前收入占比最高的两条路:月之暗面公开数据显示,2026 年 1–6 月其 ARR 从 1 亿美元翻了 3 倍至 3 亿美元,API 收入占总营收 70% 以上;DeepSeek V4 系列 2026 年 8 月第一周总调用量达 11.31 万亿 Token,但已宣布计划上调 API 定价,显示其从「低价获客」向「价值定价」过渡。
重构一:把模型层当作「可替换组件」。企业应建立模型路由层(如 LiteLLM、自研 router),按任务复杂度自动分配模型。Vercel AI Gateway 数据显示,开放权重模型处理了 29% 的 Token 但仅占 4% 的支出——这种「成本-价值」分离只有通过路由才能实现。
重构二:把许可证当作采购条款。开源模型的「免费」是有条件的。年营收、用户规模、是否提供 MaaS、是否允许衍生模型商用等条款,必须在法务审查阶段与模型能力评估同步进行。否则,今天的成本优势可能变成明天的合规负债。
重构三:把开源模型作为经营重塑杠杆。开源模型支持私有化部署,为金融、政务、医疗等数据不能出域的场景提供了 AI 员工基座。企业可以把开源模型与内部知识库、业务流程结合,构建私有 Agent 体系——这正是 AICOR 内核中「AI 员工 × 流程治理 × 经营重塑」的落地形态。
本报告数据采集时间为 2026 年 9 月 12 日,采用多轮 WebSearch 检索,主要信源包括:
1. OpenRouter 官方博客/周报 — DeepSeek V4 采用分析、周度 Token 榜单,2026。
2. 每日经济新闻 — 基于 OpenRouter 数据的中国模型周 Token 份额测算(61%),2026.07。
3. 中国工信新闻网 —《模型开源“开”出产业增长新空间》(Hugging Face 2026 夏季报告、Qwen 系列累计下载 30 亿次),2026.08.24。
4. 上观新闻(解放日报)—《中国大模型,掀翻硅谷定价逻辑》(Hugging Face 春季报告中国下载占比 41%、阿里/月之暗面收入分成),2026.08。
5. 36Kr / Brocker — 中国开源模型许可证分化调查(Qwen/Kimi 商业门槛),2026.09。
6. Mozilla Foundation —《State of Open Source AI 2026 Report》(基于 SlashData 2026 年 5 月 1494 名开发者调研及 OpenRouter 100 万亿 Token 数据集),2026.07。
7. Databricks / LangChain — 2026 年多模型/Agent 使用调研数据(78% 企业使用两个以上模型家族、67.8% Agent 部署用 OpenAI)。
8. CNBC / WSJ / Yahoo Finance — 中美模型成本对比、OpenRouter 市场份额变化,2026.07。
9. AcadeResearch / Open Source LLM Statistics 2026 — OpenRouter 路由量历史趋势、Hugging Face 下载地理分布,2026。
10. 钛媒体 / 财联社 / 长江证券研报 — 国产大模型定价与商业化趋势分析,2026。
估计值声明:OpenRouter 平台数据反映开发者/初创公司偏好,不等同于全市场企业支出;中国模型 61% 份额为单周峰值,滚动月度份额可能略低;各模型 API 价格为 2026 年 7–8 月公开定价,厂商可能随时调整;收入分成比例(最高 30%)来自市场消息与 36Kr 调查,具体条款以厂商协议为准。