在2026中国算力大会"算力首创首发发布会"专场上,移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同发布了国内首个国产GPU加类脑芯片的大模型异构混合推理系统。
该系统将Transformer模型的Attention计算与FFN模块拆分,由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载,FFN模块交由类脑芯片处理,充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势,突破传统GPU推理的"内存墙"和"功耗墙"瓶颈。项目已在DeepSeek V4 Flash大模型上完成完整调优验证。
相较同类国产GPU算力集群,该系统的推理输出和能效均提升1倍以上,业务运营成本降低40%以上。团队自研了模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度和结果聚合。
【AICOR点评】"异构混合推理"思路跳出了"只追先进制程"的单一路径,从系统架构层面寻找突破口。将Attention和FFN分给不同芯片处理,本质上是对计算任务的精细化解耦——这种思路对企业自建推理集群同样有启发:不必追求单一芯片全能,而应基于任务特征做异构编排。算力自主可控的路径不止一条,系统级创新可以弥补单点工艺差距。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。