港科大开源FreeOcc,无需训练的3D占据地图系统,推动机器人具身智能发展
近日,香港科技大学(广州)陈昶昊教授团队与穆罕默德・本・扎耶德人工智能大学(MBZUAI)合作开发的FreeOcc系统在机器人领域旗舰会议RSS 2026上获得关注。这一系统是首个无需训练的开放词汇三...
近日,香港科技大学(广州)陈昶昊教授团队与穆罕默德・本・扎耶德人工智能大学(MBZUAI)合作开发的FreeOcc系统在机器人领域旗舰会议RSS 2026上获得关注。这一系统是首个无需训练的开放词汇三维占据预测框架,标志着机器人具身感知技术的重要突破。
FreeOcc的核心创新在于其"无需训练"的设计理念。传统三维占据预测方法通常依赖大规模标注数据和精确相机位姿,但在真实开放环境中,这些假设往往难以成立。FreeOcc通过整合DROID-SLAM后端、视觉语言模型(VLM)以及高斯分布投影等技术,实现了从输入RGB-D图像序列到最终占据地图的全流程自动化处理。
具体而言,FreeOcc的工作流程包括四个主要阶段:首先利用DROID-SLAM进行点云地图构建;接着生成3D高斯分布地图;然后通过视觉语言模型实现开放词汇语义关联;最后将高斯分布投影为占据地图。这种设计使得系统能够在全新场景中快速构建高质量的3D占据地图,而无需预先标注数据或重新训练模型。
在性能测试方面,FreeOcc在EmbodiedOcc-ScanNet数据集上的单目版本达到31.29 IoU/13.86 mIoU,RGB-D版本达到34.40 IoU/15.84 mIoU,相较现有自监督学习方法在IoU与mIoU指标上均实现超过两倍提升。在跨数据集泛化基准ReplicaOcc上,RGB-D版本取得了55.65 IoU/20.90 mIoU的性能,展现了强大的泛化能力。
这一研究成果不仅解决了现有三维占据预测方法面临的两大难题——高昂的三维标注成本和跨环境泛化能力不足,也为机器人在复杂动态环境中的自主导航和交互操作提供了新的技术路径。随着FreeOcc系统的开源发布,预计将推动更多研究机构和企业在具身智能领域的探索与发展。
FreeOcc的出现正值人工智能和机器人技术快速发展之际。当前,全球范围内对高效、可靠的三维环境感知技术需求日益增长,特别是在智能家居、自动驾驶、工业自动化等领域。FreeOcc系统凭借其独特的设计理念和技术优势,有望成为下一代机器人感知系统的重要基础组件。
值得注意的是,FreeOcc的成功也反映了近年来开源软件在推动技术创新方面的重要作用。通过公开源代码和数据集,研究人员可以快速复现和改进现有成果,加速技术迭代。这种开放协作的模式正在成为科技创新的重要驱动力。