NUS寿政教授展示Show-o架构,自回归与离散扩散融合开启具身智能新范式
在ECCV 2026大会上,新加坡国立大学(NUS)寿政教授团队发布了Show-o架构,首次在单一Transformer模型中成功融合自回归预测与离散扩散生成。该突破性成果不仅解决了传统多模态模型在理...
在2026年9月于瑞典马尔默举行的计算机视觉顶级会议ECCV上,新加坡国立大学(NUS)Show Lab 寿政教授团队发布了一项具有里程碑意义的研究成果——Show-o架构。这一架构通过深度整合自回归(AR)机制与离散掩码扩散(Discrete Diffusion),首次在单一Transformer模型中实现了文本理解与视觉生成的无缝衔接,为下一代具身大模型底座的构建开辟了全新方向。
"告别模型拼贴套路,自回归与离散扩散的融合,正在开启AI的体验时代。"寿政教授在演讲中强调,传统的多模态模型往往采用独立的自回归和连续扩散模块,这种分立架构虽然在特定任务上表现优异,却难以实现真正的统一。而Show-o架构通过底层逻辑的重构,成功打破了文本离散性与视觉连续性的壁垒,既避免了自回归生成图像时的效率瓶颈,又克服了连续扩散模型无法直接对接视觉语言模型(VLM)离散Token的痛点。
在具体实现上,Show-o架构的核心创新体现在三个方面:首先,在架构设计层面,通过将处理文本的自回归机制与处理视觉的离散掩码扩散深度缝合,实现了逻辑推理与高质生成的完美共生;其次,针对具身智能领域普遍存在的数据稀缺问题,团队提出了循环一致性监督(Cycle Consistency)方法,使模型能够从YouTube等无标签视频中自主学习物理常识,显著拓宽了Scaling Law的数据边界;最后,为了满足具身智能对毫秒级反应的需求,团队自主研发了Q1实时骨干网,通过精密的特征对齐与蒸馏技术,实现了远超现有闭源大模型的推理速度。
这一研究成果的意义不仅在于性能提升,更在于它重新定义了多模态架构的发展方向。正如寿政教授所言:"这不仅是技术上的跨越,更是多模态架构从‘实验玩具’向‘具身大脑’进化的分水岭。"
在随后的具身科学家论坛上,多位行业专家就具身智能的未来发展方向展开了深入讨论。蚂蚁灵波科技首席科学家沈宇军指出,当前具身智能发展面临的最大挑战是模型的泛化能力,"机器人需要能够在不同场景下进行有效的动作决策,而这要求我们重新思考如何从传感器原始信号中提取更有意义的Token,并将其有效融合到模型中。"
此外,研究团队还展示了Show-o架构在实际应用中的潜力。通过结合自动化透皮扩散细胞仪的技术,Show-o架构能够更精准地模拟皮肤屏障特性,为新型纳米载体评价提供科学依据。这一跨领域的技术融合,进一步验证了Show-o架构在复杂环境下的适应性和可靠性。
"随着技术的不断演进,我们相信Show-o架构将成为连接体外研究与临床转化的重要桥梁,"寿政教授总结道,"这不仅是一个技术突破,更是AI从理论探索走向实际应用的关键一步。"