9 月 7 日,视启未来(深圳)科技有限公司联合清华大学、粤港澳大湾区数字经济研究院(IDEA 研究院)发布空间智能模型 SpatialPoint。该模型试图解决现有视觉语言模型“看得见物体却说不清在哪里行动”的痛点,将 AI 能力从“理解世界”推进到“确定行动位置”。
SpatialPoint 融合 RGB 图像、深度信息和自然语言三类数据,直接输出相机坐标系下的结构化三维坐标。团队将机器人所需的空间信息抽象为两类核心点位:附着于物体表面的“实点”(对应抓取、按压等接触操作)和位于自由空间的“虚点”(对应放置、导航、避让等)。
实测数据显示,在需要实体接触的实点任务中,有效操作位置准确率达 79%,三维距离预测平均误差仅 17.2 毫米,较传统纯 RGB 方案精度提升超 30 倍。该模型已完成多场景真实机器人部署验证,并与多个产业团队开展视觉智能、机器人技术及产业应用探索。
【AICOR 点评】SpatialPoint 补齐了具身智能“最后一公里”——从认知到行动的空间定位。AICOR 认为,这预示着机器人产业将从“执行预设程序”转向“理解现场并自主决策”,制造业柔性生产、仓储物流、零售服务等场景将迎来重新洗牌。企业布局具身智能时,不应只关注硬件本体,而应优先构建“空间感知 + 任务理解 + 安全执行”的算法大脑。
版权声明 本文由 AI 辅助整理,基于公开报道转写,信息版权归原作者及原媒体所有;内容仅作行业信息分享,不构成任何投资或商业建议。
如涉版权问题,请联系 AICOR(400-601-8080 / 微信 aicor-ai),我们将在收到通知后及时处理。