谷歌Gemini2.0发布,原生多模态与Agent能力双升级
谷歌在Gemini 1.0发布10个月后,正式推出Gemini 2.0系列模型。该版本主打原生多模态输入输出能力,性能超越1.5 Pro,同时为构建AI Agent奠定基础。文章详细介绍了Gemini...
在人工智能领域,谷歌再次迈出重要一步。继2023年12月发布Gemini 1.0以来,谷歌于2024年12月12日推出了Gemini 2.0系列模型,标志着AI大模型进入原生多模态时代。
作为DeepMind CEO哈萨比斯(Demis Hassabis)口中“整整提升了一个档次”的新一代模型,Gemini 2.0不仅延续了前代的高性能表现,更在多个维度实现了突破性进展。与1.5 Pro相比,Gemini 2.0 Flash在关键基准测试中表现出色,其速度更是达到了1.5 Pro的两倍。更重要的是,它首次实现了原生多模态输入输出能力,能够直接生成音频和图像内容,为AI Agent的发展奠定了坚实基础。
在具体功能方面,Gemini 2.0带来了多项创新。首先,它支持文本、图片、视频和音频等多模态输入,并能生成包含文本、音频和图像的集成响应。这种能力使得开发者可以构建更加丰富的交互体验,例如生成包含视觉元素的食谱或报告。其次,Gemini 2.0具备原生文本转语音功能,提供8种高质量语音选择,涵盖多种语言及口音,为跨语言应用提供了便利。
此外,Gemini 2.0还增强了工具调用能力,可以直接调用Google Search、代码执行等工具,并通过函数调用方式集成第三方功能。这使得AI助手能够更智能地处理复杂任务,例如同时进行多源信息检索并综合分析结果。
除了核心模型的升级,谷歌还同步推出了Project Astra的新版本。基于Gemini 2.0 Flash,Project Astra在对话流畅度、工具使用能力和记忆能力等方面均有显著提升。它现在可以在多种语言和混合语言之间进行对话,并且能够更好地理解不同口音和生僻单词。同时,Project Astra新增了对Google Search、Google Lens和Google Maps的支持,使其在日常生活中的助手作用更加突出。
在应用场景方面,Gemini 2.0及其相关产品已经展现出广泛的应用潜力。开发者可以在Google AI Studio和Vertex AI平台上使用Gemini 2.0 Flash模型,构建实时多模态应用。这些应用可以支持来自摄像头或屏幕的音视频流输入,实现自然对话模式下的打断和语音活动检测。
值得注意的是,谷歌并未止步于此。在Gemini 2.0发布的同时,谷歌还宣布推出搭载Live Avatar功能的Gemini 3.8 Live版本。这一功能将视频生成与语音结合,打造能倾听、观察并以动态视觉形象交流的交互体验。Live Avatar具备精准唇形同步、自然表情和流畅的对话轮次切换能力,可同时处理视觉与音频输入,进一步提升了AI交互的沉浸感和真实感。
总的来说,Gemini 2.0的发布标志着AI大模型技术进入了一个新的发展阶段。通过原生多模态输入输出能力和强大的工具调用能力,Gemini 2.0不仅提升了现有应用的功能边界,更为构建下一代AI Agent奠定了基础。随着这些新技术的逐步落地,我们有望看到更多创新性的AI应用和服务出现,推动整个行业的快速发展。
