9 月 13 日,DeepSeek 正式上线 V4.1 Flash 大模型,新版本采用 5520 亿参数的混合专家架构,单次推理仅激活约 370 亿参数,在不显著牺牲输出质量的前提下,把长上下文场景的显存占用压缩到上一代的四分之一左右,长文本问答与代码生成两类任务的首 token 延迟均有可观下降。
公开基准方面,V4.1 Flash 在 Terminal-Bench 2.1 真实命令行任务测评中获得 90.6 分,在内部数学与中文写作两套测试上均超过同尺寸开源模型的最佳成绩。模型权重继续以 MIT 协议开源,企业可下载至本地部署,亦支持主流云厂商一键调用。
值得关注的工程细节是 KV Cache 的分组压缩算法。研究团队把多组注意力键值做按位量化,在 200K 上下文长度下仍能维持生成质量稳定。这意味着在金融研报、合同审阅、长代码库理解这类强长文本业务里,单张推理卡能并发的会话数显著提升,整体单位成本下行。
【AICOR 点评】Flash 系列一直承担 DeepSeek 落地引擎的角色,V4.1 Flash 的显存与 KV 优化直指企业最关心的 TCO——推理硬件更省、并发更高,是把开源模型推向生产环境的关键一公里。对正在做私有化部署、Agent 平台和多业务线算力调度的团队来说,这类显存工程优化往往比单纯刷榜更有实际价值。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。