AI虚拟助手Griffin实时视频通话以假乱真,近半数人无法分辨真假

美国AI公司Tavus发布的Griffin模型在视频通话测试中表现出色,54名参与者中有26人误认为对方是真人。该模型通过全双工交互和多模态感知技术,实现了自然流畅的对话体验,标志着AI数字人在交互能...

人工智能

近日,美国人工智能公司Tavus发布了一款名为Griffin的全新AI模型,这款模型在视频通话场景下的表现令人惊叹。根据官方公布的数据,在一项针对54名参与者的测试中,有26人(占比约48%)误以为屏幕另一端是一位真人,而非AI虚拟助手。这一结果远超其上一代系统的表现——后者在相同测试中仅有1人(2.4%)被误认为是真人。

Griffin模型的核心创新在于其突破性的交互能力。与传统的级联式AI系统不同,Griffin采用了全双工视频交互方案,能够同时进行语音输出和接收处理。这种设计使得模型能够在用户说话时实时生成回应,而无需等待对方完全结束发言。例如,在一段演示视频中,Tavus联合创始人Hassaan Raza与虚拟助手Vanessa进行了一次长达一分钟的视频对话。Vanessa不仅能够理解Hassaan的表情和语气,还能适时地做出点头、微笑等自然反应,甚至在Hassaan提到自己穿着二手衣服时,Vanessa幽默地回应说"我会保持呼吸平稳,以免耗尽你的CPU"。

文章配图

为了实现这种高度拟真的交互效果,Griffin采用了两个主要的技术模块:持续对话建模引擎和音视频生成引擎。对话建模引擎以小于一秒的间隔重新评估交流状态,从而实现在对话过程中随时调整回应策略。音视频生成引擎则负责将这些决策转化为连续的声音和画面,确保整个交互过程的流畅性。此外,Gr Griffin还具备强大的视觉生成能力,可以从一张参考图像出发,实时生成包括人物面部表情、手势动作以及背景环境在内的完整画面。

这项技术的进步不仅体现在交互的自然度上,更在于它对传统视频通话模式的颠覆。在过去,视频通话常被视为确认身份的最后一道防线,但随着AI技术的发展,这种防线也开始变得脆弱。Griffin的成功表明,AI已经能够模拟人类的非语言交流特征,如眼神接触、面部表情变化和肢体语言,从而使虚拟助手在视频通话中几乎可以以假乱真。

尽管Griffin目前仍处于预览阶段,但其表现已经引起了广泛关注。业内人士认为,这项技术的突破将推动AI数字人在更多领域的应用,从客户服务到远程教育,再到虚拟社交,都有可能迎来新的变革。然而,这也引发了关于隐私保护和伦理问题的讨论,特别是在AI能够如此逼真地模仿人类行为的情况下,如何确保用户知情权和数据安全成为亟待解决的问题。

总的来说,Griffin模型的发布标志着AI数字人在交互能力上的重大突破,它不仅展示了AI技术的巨大潜力,也为未来的数字人发展指明了方向。