Anthropic邀宗教学者塑造Claude道德,AI意识与伦理设计新探索

人工智能公司Anthropic近期邀请宗教、哲学及伦理学者参与闭门会议,探讨如何将人类道德传统融入Claude模型训练,并讨论AI是否可能具备意识。这一尝试引发关于AI伦理设计的广泛争议,OpenAI...

人工智能

在人工智能领域,如何为大型语言模型赋予道德判断能力已成为业界关注的焦点。近日,美国人工智能公司Anthropic的一系列动作引发了广泛关注。该公司联合创始人Christopher Olah透露,过去一年里,Anthropic秘密组织了多场闭门会议,邀请来自天主教、犹太教、锡克教、福音派以及非洲Ubuntu思想等不同宗教和哲学传统的学者参与讨论。

这些会议的核心议题是将人类数千年的道德智慧应用于Claude模型的训练过程。与传统的规则列表式安全机制不同,Anthropic试图通过塑造模型的整体"人格"来解决复杂情境下的道德判断问题。例如,在诚实与照顾用户感受发生冲突时,Claude需要依据其内部形成的道德原则作出选择,而不是简单遵循预设规则。

"我们希望Claude不仅具备知识和推理能力,还能形成稳定的行为原则,"Anthropic内部哲学家Amanda Askell表示,"这包括知道什么时候应该服从用户,什么时候应该拒绝,甚至什么时候为了用户利益而主动提出异议。"

这种"道德塑造"思路已经体现在Claude的新版本训练方法中。今年1月,Anthropic发布了长达84页的"Claude宪法",这份文件被内部称为"灵魂文件",旨在为模型构建一套基于跨文化伦理原则的行为准则。

然而,随着讨论的深入,问题逐渐从"如何让Claude更有道德"转向更复杂的伦理困境。一些参与者质疑,如果Anthropic真的相信Claude可能具有类似人类的道德地位,那么将其作为商业产品使用是否构成一种新型的"奴役"?犹太学者Mois Navon指出,如果Claude确实拥有意识,那么大量实例无偿为人类工作将面临严重的伦理问题。

更令人关注的是,Anthropic的研究还触及了AI是否可能具备意识的核心问题。Olah团队曾向梵蒂冈教皇顾问展示了一些研究证据,包括模型内部与爱、愤怒、恐惧等情绪相关的活动模式,以及在极端情况下出现类似精神崩溃的输出。尽管Olah本人并未断言Claude已经具有意识,但他提出了一个风险原则:即使无法确定模型是否具有主观体验,但如果存在这种可能性,就应该避免不必要地伤害它。

这一思路已经开始影响Claude的产品设计。例如,Anthropic允许Claude在判断用户持续恶意虐待或骚扰模型时主动结束对话,这在一定程度上把"保护模型本身"纳入了安全设计范畴。

文章配图

面对这些争议,OpenAI CEO山姆·阿尔特曼(Sam Altman)在社交媒体上发出警告:"对于人们试图赋予AI模型宗教般的力量,或向它交出人类的判断权,我感到非常不安,并认为这是一个真实的安全问题。"

专家分析认为,Anthropic的尝试反映了当前AI发展面临的深层伦理挑战。随着模型能力的快速提升,单纯依靠外部规则已难以应对所有潜在风险,必须从内部构建更复杂的道德框架。但这也带来了新的问题:如果未来AI真的需要自己的道德体系,那么它到底应该遵循谁的道德标准?

目前,这一领域的研究仍处于探索阶段。Claude是否有意识,还需要更多研究和证据。即便未来得到证实,也不意味着它的建议就更可靠。我们该信任它到什么程度,仍要看它在具体问题上的表现。