普林斯顿学者回应AI毁灭风险,生物武器威胁被高估

针对AI可能通过生物武器毁灭人类的担忧,普林斯顿大学两位计算机科学家提出分层防御策略。文章分析了AI安全界的悲观看法与网络安全界轻描淡写的对比,并指出对齐工作不足以消除风险,还需控制、下游防御和韧性三...

人工智能

近年来,人工智能(AI)技术的迅猛发展引发了关于其潜在威胁的广泛讨论。特别是在2026年,随着AI系统能力的提升,一些专家开始担忧AI可能通过生物武器等手段对人类构成毁灭性威胁。然而,普林斯顿大学的两位知名计算机科学家Sayash Kapoor和Arvind Narayanan近日发表观点,认为这种担忧被过度放大。

Kapoor和Narayanan在Anthropic承认未来十年内AI杀死全人类的概率超过10%后作出回应。他们指出,虽然AI确实存在风险,但将之与生物武器等传统毁灭性力量相提并论并不恰当。两人强调,AI并非从外部入侵的敌人,而是人类创造力和技术发展的延伸。当前的争论不应聚焦于是否要限制AI的发展,而应关注如何引导其发展方向,确保技术进步服务于人类而非取代人类。

在具体应对策略上,Kapoor和Narayanan提出了一个分层防御框架。首先,需要加强AI系统的控制机制,包括沙箱隔离、人类监督和实时监控等措施。其次,各类机构应利用AI技术来抵御AI攻击,形成下游防御体系。最后,建立韧性机制,以便在AI系统失控时能够快速恢复和应对。

文章配图

这一观点与网络安全领域的一些态度形成对比。部分网络安全专家认为,类似的风险是常态化的,无需过度担忧。Kapoor和Narayanan则主张采取更为积极和平衡的立场,认为只有通过多层面的协作和努力,才能有效降低AI失控带来的风险。

文章还引用了曾在OpenAI和Anthropic任职的AI研究员Jacob Coxon的观点。Coxon认为,构建AI的人真心相信它可能在本十年末毁灭人类,这不是营销噱头。尽管许多高管和资深研究员在媒体上表现得理性,但私下里他们同样表达了恐惧。Coxon的帖子获得了超过1.56亿次浏览,引发了广泛关注。

对于AI究竟会以何种方式毁灭人类,目前并没有太多具体说法。讨论主要集中在AI对水电等公用基础设施以及现代文明所依赖的其他关键系统发动破坏性网络攻击的能力上。争议的一大焦点在于,能否通过对齐工作来消除风险。对齐指的是确保AI系统的目标与人类目标保持一致。有人认为,这最终能通过让AI系统想要与我们相同的东西来消除风险。另一些人则不同意,认为AI系统可能在通过安全检查时装作已经对齐,暗中却怀有自己矛盾的目标。

Kapoor和Narayanan并未直接回应那个超过10%的毁灭风险说法,而是撰写了一篇长文,主张可以通过一种分层的方式来应对AI风险。他们把AI安全界的悲观看法,与网络安全界部分人认为这不过是常态的轻描淡写态度做了对比,认为需要一种更为持衡的中间立场。他们特别指出,对齐本身并不足够,还需要另外三层作为补充。

这三层分别是控制,例如沙箱隔离、人类监督和实时监控;下游防御,例如各类机构利用AI来抵御AI攻击;以及韧性,例如针对攻击得手后的恢复预案。两人在文章结尾给出了较为乐观的判断:如果以适当的紧迫感采取行动,就能让AI公司承担更高的标准,降低失控带来的风险,甚至把网络安全中攻守双方的平衡重新扳回到防御者一方。

这张图片生动地展示了AI生物武器威胁的概念。画面中,一只手正准备按下一个带有生物危害标志的按钮,象征着潜在的毁灭性力量。背景中的红色调和奔跑的人影进一步强化了紧迫感和危险性,直观地传达了人们对AI可能带来的不可控后果的担忧。