3D几何增强视觉大模型,港科大谭平揭示跨视角一致性新突破
在ECCV 2026会议上,香港科技大学教授谭平提出将3D几何与深度学习结合的新方法,解决视觉大模型在多视角、长距离场景生成中的全局一致性难题。该研究通过显式几何约束提升大规模3D重建和场景生成的准确...
近年来,随着生成式AI技术的快速发展,视觉大模型在单帧图像和局部视频生成方面取得了显著进展。然而,在需要跨视角、长距离保持3D一致性的复杂场景生成任务中,仅依赖数据驱动的局部先验仍存在明显局限性。香港科技大学教授谭平在ECCV 2026上的演讲中,深入探讨了如何利用3D几何增强视觉大模型的全局一致性能力。
谭平指出,当前主流的基于Transformer的3D重建方法虽然在局部细节上表现出色,但在处理大规模场景时面临计算瓶颈和结构一致性问题。为此,他的团队提出了"SAIL-Recon Method",通过关键帧采样、场景特征提取和全局注意力机制,实现了高效的3D重建。这种方法不仅提升了重建精度,还显著降低了计算资源需求。
在场景生成方面,谭平团队创新性地将3D几何约束引入生成模型。通过构建显式的3D布局或代理(Proxy),并在后续阶段补充外观与细节,这种方法有效改善了大规模场景漫游时的空间一致性。例如,在生成包含多个房间的虚拟建筑时,能够确保不同视角下的结构逻辑连贯,避免出现如"卧室有多张床"等不合理现象。
这项研究的重要意义在于,它为视觉大模型与传统3D计算机视觉方法的融合提供了新的范式。通过将学习方法的表达能力和多视图几何、全局优化等经典3D方法相结合,既保留了深度学习在特征提取方面的优势,又利用几何约束解决了全局一致性问题。这种"学习先验+几何约束"的双轨策略,为构建更真实、可交互的3D世界模型奠定了基础。
此外,谭平的研究还展示了3D几何增强技术在工业应用中的潜力。例如,佳能推出的Dual Pixel 3D Converter软件,正是利用相机拍摄照片中的深度信息直接生成3D模型,这与谭平团队的研究思路不谋而合。未来,这种结合3D几何约束的视觉大模型有望在智能制造、虚拟现实、城市规划等领域发挥重要作用。