9 月 7 日,视启未来(深圳)科技有限公司联合清华大学、粤港澳大湾区数字经济研究院(IDEA 研究院)发布空间智能模型 SpatialPoint。该模型试图解决现有视觉语言模型“看得见物体却说不清在哪里行动”的痛点,将 AI 能力从“理解世界”推进到“确定行动位置”。
SpatialPoint 融合 RGB 图像、深度信息和自然语言三类数据,直接输出相机坐标系下的结构化三维坐标。团队将机器人所需的空间信息抽象为两类核心点位:附着于物体表面的“实点”(对应抓取、按压等接触操作)和位于自由空间的“虚点”(对应放置、导航、避让等)。
实测数据显示,在需要实体接触的实点任务中,有效操作位置准确率达 79%,三维距离预测平均误差仅 17.2 毫米,较传统纯 RGB 方案精度提升超 30 倍。该模型已完成多场景真实机器人部署验证,并与多个产业团队开展视觉智能、机器人技术及产业应用探索。
【AICOR 点评】SpatialPoint 补齐了具身智能“最后一公里”——从认知到行动的空间定位。AICOR 认为,这预示着机器人产业将从“执行预设程序”转向“理解现场并自主决策”,制造业柔性生产、仓储物流、零售服务等场景将迎来重新洗牌。企业布局具身智能时,不应只关注硬件本体,而应优先构建“空间感知 + 任务理解 + 安全执行”的算法大脑。
Copyright Notice This article is AI-assisted, rewritten from public reports. Copyright of the information belongs to the original authors and media; content is for industry sharing only and does not constitute investment or business advice.
For copyright concerns, contact AICOR (400-601-8080 / WeChat: aicor-ai); we will handle it promptly upon notification.