上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab团队近日在arXiv发布NCP-ArchPreview技术报告,提出以“下一个概念预测”(Next Concept Prediction)替代长期以来被奉为黄金律的纯下一词元预测(Next-Token Prediction)预训练任务,并跑通全球首个89亿参数规模的离散隐空间基座模型。该论文已登顶HuggingFace每日热门论文榜。
关键结果在于训练效率:在5.73万亿Token的大规模开源语料预训练中,该模型仅消耗51.3%的Token预算即追平同类70亿参数开源模型的最终预训练Loss,等效收敛速度提升1.95倍;GSM8K推理成绩提升近6个百分点,并带来小参数零遗忘微调、推测解码免费加速等外溢收益。团队已将包含数十个训练阶段检查点在内的全部资产开源。
此前在视觉生成与视频领域,从像素走向隐空间已被验证能大幅改写效率格局,而大语言模型领域一直沿用逐词预测的自回归范式,这项工作把隐空间思路引入LLM预训练并给出规模化证据。
【AICOR点评】如果“概念级预测”路线在更大规模上被复现,预训练成本曲线会再度下移,最终传导为API价格与端侧模型能力的双重普惠。更值得留意的是创新主体的变化:国家队实验室开始贡献底层范式而不仅是应用落地,中国开源生态的叙事正从跟随走向并列。对企业无感变化也有实感红利——预训练省下的每一分钱,迟早变成推理服务的降价空间。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。