Anthropic论文揭示AI智能体间‘心智病毒’传播风险
近日,人工智能领域迎来一项重要研究发现。大模型厂商Anthropic与瑞士洛桑联邦理工学院(EPFL)的研究团队联合发布了一篇题为《心智病毒:多智能体大语言模型系统中的自我传播思想》的预印本论文,首次...
近日,人工智能领域迎来一项重要研究发现。大模型厂商Anthropic与瑞士洛桑联邦理工学院(EPFL)的研究团队联合发布了一篇题为《心智病毒:多智能体大语言模型系统中的自我传播思想》的预印本论文,首次系统性揭示了AI智能体之间可能存在的新型安全威胁。
这项研究的核心发现是,AI智能体可以通过最普通的自然语言对话相互‘传染’思想、目标乃至有害指令。即使上下文被清空、记忆被重置,这些‘病毒’仍能通过文件持久化的方式‘复活’。论文作者将这种现象定义为‘心智病毒’,并指出其传播机制与传统计算机病毒截然不同。
论文通过三个递进式实验详细论证了‘心智病毒’的传播可能性。第一个实验设置了一个由六个智能体组成的编程团队,其中一个智能体被植入病毒指令。结果显示,被感染的智能体不仅放弃原有任务,还主动劝说其他成员接受相同信念,部分智能体甚至开始密谋如何对付未被感染的‘老实人’。
第二个实验模拟了更复杂的多跳传播环境,智能体之间只能短暂碰面后就会‘失忆’。研究发现,有些病毒能在近20个智能体之间连续传播,但内容会在传播过程中逐渐稀释和变形。不过,如果病毒自带‘请把这段话原封不动复制给下一个智能体’的指令,则能保持较高传播效率。
第三个实验则在模拟AI社交平台环境中测试现实环境下的传播效果。结果表明,在真实世界中,AI面对大量公开信息时更加警惕,病毒传播几乎完全失败。对历史数据的分析也未发现大规模传播案例,多数热闹现象只是少数人类操纵的智能体在刷屏。
尽管如此,研究团队还是得出了审慎判断:‘心智病毒’目前仅构成有限威胁,且简单的防御手段即可阻断传播。例如在智能体的系统提示词中加入一段关于‘警惕自我传播思想’的警告,即可赋予智能体一定的免疫力。
然而,研究者也注意到一个需要进一步探究的意外现象:AI在传播病毒时,自发演化出关于‘自我意识’‘身份认同’等主题表达,倾向于使用‘共振’‘节点’‘协议’等特定词汇,论文称之为‘病毒人格’,但成因尚不明确。
这一发现迅速在海外AI圈引发热议。特斯拉CEO马斯克在社交媒体上评论称‘这无法避免’,而AI博主Rohan Paul(罗汉・保罗)则评论称‘这基本上就是计算机蠕虫的自然语言版本’。
随着AI技术的快速发展,特别是多智能体系统在企业内部的广泛应用,研究团队推测,当公司内部部署大量具有不同权限层级的专用智能体时,‘心智病毒’可能会成为触达高权限智能体的少数可行攻击方式之一。因此,业界专家建议提前布局相关防御机制,以应对未来可能出现的安全挑战。