行业观察

DeepSeek 发布 V4.1-Flash:性能超越 V4 Pro,KV 缓存成本大幅压缩

Published 2026-09-12 Author Source 极客公园 · https://www.163.com/dy/article/L6HIDP1U05119FMA.html · 2026-09-11 Tags AI-Native Organization / Self as Product / Launch
DeepSeek 新模型以非对称 MoE 架构实现输入与输出激活分离,并在多项基准上超过前代旗舰,同时显著降低长上下文与智能体任务成本。

事件:2026 年 9 月 10 日,深度求索(DeepSeek)正式发布 V4.1-Flash 多模态模型,并同步上线 API、开源权重,以 MIT 许可开放商用。

关键事实:该模型总参数量为 5520 亿的混合专家(MoE)架构,采用全新的 Causal-Encoder-Decoder 非对称结构:读取输入时每个 token 仅激活 80 亿参数,生成输出时激活 160 亿参数。DeepSeek 表示,这种设计显著降低了智能体频繁调用工具、反复读取上下文场景下的计算开销。同时,新架构将 GPU 显存中的 KV 缓存占用压缩至上一代约四分之一,持久化缓存所需的 SSD 存储降至约八分之一。官方公布的基准显示,V4.1-Flash 在 Agentic Benchmark 等评测中超过此前的 V4 Pro 旗舰。价格方面,API 最高降幅达 60%,9 月 14 日起 V4 Pro 请求将被路由至 V4.1-Flash。

影响:通过把能力更强、价格更低的模型同时推向市场,DeepSeek 正在加速推理成本的下降。这对需要维护大量长上下文的代码助手、客服智能体和研究辅助工具尤其有利。

【AICOR 点评】

大模型竞赛已经进入"单位智能成本"决胜阶段。DeepSeek 用架构创新而非单纯堆参数实现了性能与成本的双重突破,这对中国企业具有示范意义:在高端芯片供给受限的背景下,算法和工程优化是建立成本优势的关键路径。AICOR 认为,具备低成本长上下文能力的模型,将是未来企业 AI 重构流程治理时的首选底座。

Copyright Notice This article is AI-assisted, rewritten from public reports. Copyright of the information belongs to the original authors and media; content is for industry sharing only and does not constitute investment or business advice.

For copyright concerns, contact AICOR (400-601-8080 / WeChat: aicor-ai); we will handle it promptly upon notification.

← Back to News