行业观察

中国团队两次刷新大模型训练速度世界纪录,代码并入官方开源仓库

发布日期 2026-09-10 作者 信息来源 中国新闻网/今日头条 · https://www.toutiao.com/article/7683500912858284544/ · 2026-09-09 标签 AI原生组织 / 自身即产品 / 上线
彩云科技团队在NanoGPT Speedrun项目中两次提交方案,将GPT-2小型模型达标训练时间压缩至1分16秒,相关代码已并入官方仓库。

事件:来自中国的彩云科技团队在开源AI技术竞速项目NanoGPT Speedrun中,今年两次提交方案并两度改写世界纪录,最终将8张H100显卡训练1.24亿参数GPT-2小型模型至规定标准的时间压缩到1分16秒。相关代码已被官方仓库接纳,全球开发者可自由复现与迭代。

项目背景:NanoGPT Speedrun由海外研究者发起,面向全球开发者开放比拼。项目规则统一:使用8张H100显卡、固定数据集,以训练达标时间为比拼指标。该项目已持续两年多,训练时间接近硬件理论极限,社区维护者认为想要再往前挤出来几秒,必须从模型底层结构进行创新。

技术创新:彩云科技团队贡献了两项原创性架构创新——DCMHA(可动态组合多头注意力)和MUDD(多路动态稠密连接)。DCMHA让模型内部信息处理单元根据内容灵活协作,提升信息处理效率;MUDD为层间信息传递加装智能阀门,让模型自主调控信息通路,避免固定连接带来的效率损耗。

行业意义:在硬件不变前提下提升训练效率,可使同批设备支撑更多实验、减少达到同等效果所需资源,对经费有限的高校课题组和中小型AI企业尤具价值。过去依赖堆算力、扩参数的发展模式正遭遇瓶颈,而改造模型内部信息流转逻辑、依靠架构创新换取效率提升,已被验证为可行路径。

AICOR 点评:彩云科技的突破给行业带来一个重要启示:当堆卡堆参数遇到边际递减,架构创新成为新的效率杠杆。1分16秒的背后不是算力的胜利,而是让数据流转更聪明的胜利。对AICOR而言,这印证了我们一直坚持的观点——AI原生组织的核心竞争力,不在于拥有多少算力,而在于能否设计出更高效的信息流转方式。无论是模型架构还是组织架构,减少固定连接、增加动态协作都是提升系统效率的通用法则。

版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。

如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。

← 返回新闻列表