GeminiLive升级无障碍功能,GuidedVision助盲人更便捷看世界

Google为Gemini Live推出Guided Vision功能,专为视障用户设计。该功能通过实时语音描述摄像头画面,并指导用户调整拍摄角度,使盲人能更直观地感知周围环境。同时,Gemini 4...

人工智能

近日,Google宣布为其Gemini Live应用推出一项重要更新——Guided Vision功能,旨在为盲人和低视力用户提供更强大的视觉辅助能力。这一功能的推出标志着Google在无障碍技术领域迈出了重要一步,让智能手机摄像头真正成为视障用户的'眼睛'。

Guided Vision的核心在于其能够实时描述摄像头所捕捉的画面内容,并通过语音指导用户调整拍摄角度或位置。例如,当用户将手机摄像头对准某个物体时,Gemini可以立即用语音解释该物体是什么、它位于什么位置,以及如何调整摄像头以获得更好的视野。如果需要更清晰的画面,系统还会提示用户进行相应的操作,如'请向右移动'或'请后退几步'。

文章配图

这项功能支持Android 9及以上版本设备,并已在Gemini Live支持的市场中上线。对于视障用户而言,这不仅意味着他们可以通过手机获取更多信息,还能更自主地探索周围的世界。Google表示,Guided Vision是其在过去一年中持续优化视觉辅助功能的成果,此前已推出了屏幕对象高亮等基础功能,此次升级则将视觉辅助提升到了全新的高度。

与此同时,Google也正式发布了其最新的旗舰模型Gemini 4 Argon。这款模型延续了Google在大型语言模型领域的优势,特别是在知识理解和长文本处理方面表现突出。官方数据显示,在18项测试中,Gemini 4 Argon有13项领先其他模型,尤其是在金融分析和法律工作相关的测试中,其表现甚至超越了其他所有模型两档。

值得注意的是,Gemini 4 Argon在编程能力上虽然有所提升,但在代码构建和终端操作方面的表现仍显不足。不过,其在长上下文处理上的突破性进展尤为引人注目。该模型将输出上限从6.4万token提升至100万token,这意味着它可以一次性生成约70万到100万个汉字,为复杂的思维链构建提供了前所未有的空间。

此外,Gemini 4 Argon还带来了命名方式的改变,从之前的内部代号直接作为正式版名称,这种命名方式让人联想到OpenAI的模型命名风格。尽管官方未明确解释命名由来,但从字面来看,'Argon'代表第18号元素氩,与Chrome(铬)形成了有趣的化学元素对仗。

目前,Gemini 4 Argon主要通过Fairwind计划向少量网络安全合作伙伴开放,预计未来将逐步向付费API用户和Google AI Ultra订阅者开放。对于普通用户而言,还需要等待一段时间才能体验到这款强大模型带来的新功能。

总的来说,Guided Vision的推出不仅体现了Google在无障碍技术上的持续投入,也为视障用户提供了更强大的工具。而Gemini 4 Argon的发布,则展示了Google在大型语言模型领域的最新进展,特别是在知识和写作能力上的显著提升。这两项进展共同推动了人工智能技术在改善人类生活方面的应用边界。