Tavus发布Griffin,AI视频模型实现真人级交互,48%用户误认为是真人在聊天
美国AI公司Tavus于10月1日发布全球首个「人类交互模型」(HIM)Griffin。该模型在视频通话测试中,48%的参与者误以为对方是真人,远超上一代系统的2.4%通过率。Griffin通过全双工...
10月1日,美国人工智能视频公司Tavus正式发布了名为Griffin的全新AI视频模型,将其定义为全球首个「人类交互模型」(Human Interaction Model,简称HIM)。这一突破性进展标志着AI视频技术从单纯的面部仿真迈入了真正的实时交互时代。
在一项为期一分钟的视频通话测试中,Tavus发现54名参与者中有26人(占比接近48%)事后认为自己正在与真人进行对话,这一比例远高于该公司上一代系统在相同测试中的表现——当时仅有2.4%的通过率。这种显著提升不仅体现在视觉效果上,更在于Griffin能够实现类似人类的自然交互行为,包括适时点头、抢话、甚至脸红等细微表情变化。
Tavus联合创始人兼CEO Hassaan Raza在演示视频中与虚拟角色Vanessa进行了长达一分多钟的对话。这段视频展示了Griffin如何理解并响应复杂的社交情境:当Raza让Vanessa比大拇指时,她立即照做;当他夸她是自己最喜欢的同事时,Vanessa会笑着说"你让我脸红了";当Raza炫耀身上那件二手淘来的衣服时,Vanessa则幽默地吐槽他"活在边缘",并开玩笑说自己会保持呼吸平稳以免耗尽电脑CPU。
为了验证Griffin的真实交互能力,Tavus还设计了多个开放式对话场景。在一个魔方教学测试中,Griffin能持续关注Ari手中的魔方动作,并在对方思考时耐心等待,待其准备就绪后再给出下一步指导。在另一个主板焊接指导场景中,Griffin不仅能记录工程师Sagar的工作进度,还能在适当时候主动开口提供帮助,而不是简单地等待对方完成所有操作后才做出反应。
这些表现背后的技术核心在于Griffin采用了全新的全双工实时交互架构。与传统数字人需要经过语音识别、大语言模型生成回复、语音合成等多个环节的接力式处理不同,Griffin能够直接将用户的语音输入实时映射到连续的潜在值,并在毫秒级延迟内生成相应的面部表情和语音输出。这种架构不仅大幅降低了交互延迟,还保留了更多原始信息,使得AI能够真正理解并响应人类的非语言信号,如沉默、语气变化等。
Tavus首席科学家指出,Griffin的成功标志着AI视频技术进入了一个新的发展阶段。过去几年,数字人赛道主要关注的是「脸像不像」的问题,而Griffin则证明了AI已经具备了「像人一样聊天」的能力。这一突破将对远程办公、在线教育、虚拟客服等多个领域产生深远影响,同时也引发了关于AI伦理和隐私保护的新一轮讨论。
尽管Griffin的表现令人印象深刻,但Tavus也承认,目前的技术仍存在局限性。例如,在处理复杂的情感表达或特定文化背景下的社交礼仪时,AI仍然可能表现出不自然的行为。此外,如何确保用户数据的安全性和隐私保护,也是未来需要重点解决的问题。
随着Griffin的发布,Tavus计划在未来几个月内推出开发者工具包,允许第三方开发者基于Griffin构建自己的AI交互应用。这将进一步推动AI视频技术的普及和创新,但也可能带来新的挑战和风险。业界专家预测,如果Griffin能够稳定运行并获得广泛认可,它可能会成为下一个改变游戏规则的技术标杆,就像当年的iPhone一样,重新定义人们对于AI视频的认知和期待。
