2026 年 9 月 7 日,南方财经/21 世纪经济报道报道,视启未来(深圳)科技有限公司联合清华大学、粤港澳大湾区数字经济研究院(IDEA 研究院)发布空间智能模型 SpatialPoint,目标是解决机器人"识别目标之后如何在三维空间里行动"这一关键断层。
现有视觉语言模型(VLM)能回答"眼前有什么",但回答不了"应该在哪里行动"。SpatialPoint 通过融合 RGB 图像、深度信息与自然语言三类数据协同推理,将 AI 能力从"理解世界"推进到"确定行动位置",使模型输出可直接成为机器人可执行的操作指令。
IDEA 研究院讲席科学家、视启未来创始人张磊(曾任微软研究院高级研究主管)介绍,团队将机器人所需的空间信息统一抽象为两类核心点位:第一类是实点(Touchable Point),附着于物体表面,对应抓取杯柄、按压按钮、转动门把手等需直接接触的位置;第二类是虚点(Air Point),位于周边自由空间,对应物体放置、机器人导航、安全避让等位置。SpatialPoint 在传统 VLM 的 RGB 视觉输入基础上增设了专属的深度编码网络,并构建面向具身智能的空间接口。
业内观察认为,空间智能是具身智能走向产业化的关键一步。在机器人开始进入工厂产线的当下,模型输出能否与执行系统直接打通,将决定具身智能的落地速度。
【AICOR 点评】SpatialPoint 把"识别"和"行动"打通,本质上是把具身智能的关键接口标准化——这和 AICOR"AI 员工"的逻辑异曲同工:当 AI 不再只输出文字,而要直接驱动物理设备或业务流程时,模型与执行系统之间的接口就必须标准化、可审计、可回滚。中国厂商在具身智能方向上的快速工程化,是这条赛道值得长期关注的关键信号。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。