行业观察

DeepSeek 发布 V4.1-Flash:性能超越 V4 Pro,KV 缓存成本大幅压缩

发布日期 2026-09-12 作者 信息来源 极客公园 · https://www.163.com/dy/article/L6HIDP1U05119FMA.html · 2026-09-11 标签 AI原生组织 / 自身即产品 / 上线
DeepSeek 新模型以非对称 MoE 架构实现输入与输出激活分离,并在多项基准上超过前代旗舰,同时显著降低长上下文与智能体任务成本。

事件:2026 年 9 月 10 日,深度求索(DeepSeek)正式发布 V4.1-Flash 多模态模型,并同步上线 API、开源权重,以 MIT 许可开放商用。

关键事实:该模型总参数量为 5520 亿的混合专家(MoE)架构,采用全新的 Causal-Encoder-Decoder 非对称结构:读取输入时每个 token 仅激活 80 亿参数,生成输出时激活 160 亿参数。DeepSeek 表示,这种设计显著降低了智能体频繁调用工具、反复读取上下文场景下的计算开销。同时,新架构将 GPU 显存中的 KV 缓存占用压缩至上一代约四分之一,持久化缓存所需的 SSD 存储降至约八分之一。官方公布的基准显示,V4.1-Flash 在 Agentic Benchmark 等评测中超过此前的 V4 Pro 旗舰。价格方面,API 最高降幅达 60%,9 月 14 日起 V4 Pro 请求将被路由至 V4.1-Flash。

影响:通过把能力更强、价格更低的模型同时推向市场,DeepSeek 正在加速推理成本的下降。这对需要维护大量长上下文的代码助手、客服智能体和研究辅助工具尤其有利。

【AICOR 点评】

大模型竞赛已经进入"单位智能成本"决胜阶段。DeepSeek 用架构创新而非单纯堆参数实现了性能与成本的双重突破,这对中国企业具有示范意义:在高端芯片供给受限的背景下,算法和工程优化是建立成本优势的关键路径。AICOR 认为,具备低成本长上下文能力的模型,将是未来企业 AI 重构流程治理时的首选底座。

版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。

如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。

← 返回新闻列表