4K 参数校准空间表征,VLA 泛化能力提升超预期

让机器人真正理解世界,需要更大的语言模型、更逼真的视频生成,还是别的什么?雷峰网小编在中山大学与 X-Era AI Lab 团队的研究中发现了一个意外的答案:很多时候,机器人在新场景下失灵,不是因为它...

人工智能

让机器人真正理解世界,需要更大的语言模型、更逼真的视频生成,还是别的什么?雷峰网小编在中山大学与 X-Era AI Lab 团队的研究中发现了一个意外的答案:很多时候,机器人在新场景下失灵,不是因为它不懂物理,而是因为它"看到的空间变形了"。

这一突破性研究发表于 CVPR 2026,并荣获首届 Compute Transparency Champion Award。论文标题为《VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling》,其核心观点颠覆了传统 VLA 模型优化路径——即单纯堆砌数据和扩大模型规模,而是指出当前视觉-语言-动作模型(VLA)在新视角、光照、纹理和传感噪声下的脆弱性,主要源于空间建模的错位,而非物理推理或动作控制能力的缺失。

图片

图1展示了论文的核心研究框架:当机器人遇到新视角或视觉扰动时,其视觉 token 分布会发生偏移,导致空间表征错误。这种错误会进一步影响后续的动作生成。为此,研究团队提出了两种轻量级改进方法:Feature Token Modulation (FTM) 和 Feature Linear Adaptation (FLA)。

FTM 方法仅引入两个全局可学习向量,对视觉 token 做简单的仿射变换(重新缩放和重新居中),通过约 4K 个参数即可完成空间表征的重新对齐。实验结果显示,在 LIBERO 新视角任务中,FTM 将成功率从 48.5% 提升至 87.1%。

FLA 方法则在 ViT 编码器的线性层中加入低秩更新,使用约 4.7M 个参数进行更深层的特征对齐。在相同测试集上,FLA 达到 90.8% 的成功率,超过强基线 LoRA 的 90.3%,同时将模型参数量从 467M 降至 4.7M。

图2清晰地展示了 FTM 和 FLA 的工作流程:通过极少量参数校准视觉空间表征,使 VLA 在新视角下恢复鲁棒性。

这项研究的重要意义在于,它将 VLA 模型的优化焦点从"堆更多数据、上更大模型"转向了更具体的空间建模问题。研究团队指出,VLA 可以被拆解为空间建模与物理建模两个部分:视觉编码器负责空间建模,而语言-动作推理模块负责物理建模。当相机视角发生变化时,真正改变的是空间配置,而不是任务语义或物理规律。因此,新视角下的性能下降更可能来自空间表征与后端策略之间的错位,而非整个 VLA 的物理推理失效。

这一发现为具身智能系统的设计提供了新的思路:未来的 VLA 模型开发不应只关注语言知识或视觉外观的学习,还必须确保内部的空间表征能够支撑动作生成。通过精确的空间校准,即使在资源受限的情况下,也能显著提升模型的泛化能力和鲁棒性。

该研究不仅为 VLA 模型的优化提供了全新的解决方案,也为具身智能系统的研发指明了方向。随着机器人技术的不断发展,如何让机器更好地理解真实世界的空间关系,将成为未来人工智能领域的重要研究课题。