商汤开源多模态模型U1.5-Lite-Preview,4K生成与编辑能力再进化

8月3日,人工智能领域迎来一项重要进展:商汤科技正式宣布开源其最新研发的轻量级统一多模态模型预览版本——SenseNova U1.5-Lite-Preview。这款模型作为SenseNova U1系列...

人工智能

8月3日,人工智能领域迎来一项重要进展:商汤科技正式宣布开源其最新研发的轻量级统一多模态模型预览版本——SenseNova U1.5-Lite-Preview。这款模型作为SenseNova U1系列的系统性迭代产品,不仅延续了前代在单一架构中融合语言、视觉语义与像素生成的核心理念,更在多个关键维度实现了显著提升。

图片

相较于早期版本,U1.5-Lite-Preview最引人注目的特性是其对4K分辨率图像生成的支持。这一突破使得模型能够在超大画幅下依然保持清晰的局部纹理和真实世界质感,无论是自然风光还是商业摄影都能呈现细腻的光影层次。例如,在一张横跨2018至2026年的上海世界人工智能大会(WAIC)发展历程长卷中,模型成功将城市景观、智慧交通、云计算等复杂元素以传统中国山水长卷的形式呈现,且放大后细节依然清晰稳定。

此外,U1.5-Lite-Preview在文字生成与版式组织方面也取得重大进展。通过优化对长篇自然语言和结构化视觉指令的理解能力,模型能够更准确地处理中英文文字,并支持复杂的版式设计。一个典型案例是使用1675词的超长prompt生成的“背包产品解析”信息图,该图包含复古博物学标本图鉴风格、五章结构、中英双语对照及拉丁文标注等多重约束,充分展示了模型在信息密集内容中的稳定表现。

为了降低复杂视觉指令的编写门槛,商汤还配套开发了实验性的Prompt Enhance Skill功能。该工具可以自动将用户简短的想法整理成包含主体、布局、风格、文字和各项约束的完整创作方案,从而帮助用户更周全地表达需求,减少因描述遗漏导致的效果偏差。

值得注意的是,尽管U1.5-Lite-Preview仅以8B-MoT的轻量级规模运行,但在多项主流生成与编辑质量评测基准上已显著超越前代U1。这意味着,未来的多模态模型不仅应该具备跨越不同模态进行学习和创造的能力,更应能在有限资源下实现高性能表现。

目前,SenseNova U1.5-Lite-Preview已在GitHub、Hugging Face及魔搭社区提供开源下载,面向专业用户的交付级创作模型U1 Pro也正在紧密邀测中。这一系列动作表明,商汤正加速推进其在统一多模态领域的技术落地与生态建设。