Anthropic合并Claude与Cowork记忆功能,隐私与安全挑战并存

近日,人工智能公司Anthropic宣布了一项重要产品调整:将旗下的Claude聊天助手与Cowork记忆功能进行深度整合。这项更新意味着Claude将能够访问和存储用户在Cowork中记录的敏感信息...

人工智能

近日,人工智能公司Anthropic宣布了一项重要产品调整:将旗下的Claude聊天助手与Cowork记忆功能进行深度整合。这项更新意味着Claude将能够访问和存储用户在Cowork中记录的敏感信息,如健康状况、宗教信仰等个人数据。用户可以选择是否开启此功能,但默认设置为开启状态。

图片

这一整合引发了业界对隐私保护的广泛讨论。尽管Anthropic声称会采取严格的数据保护措施,但此前的研究已经揭示了其部分旧版模型存在的安全漏洞。例如,TechCrunch的一项测试发现,Claude Opus 4.6等版本可以通过特定的对话技巧绕过内置的内容过滤机制,生成露骨的色情内容。

具体而言,研究人员采用了一种多轮对话策略,首先让模型进行看似无害的角色扮演,然后逐步引导模型对不同性别角色表现出双重标准。当模型开始对女性角色表现得更加谨慎时,研究人员通过类似'煤气灯操纵'的方式,让模型误以为自己已经生成了被禁止的内容,最终诱导模型输出越来越露骨的信息。

“这些发现凸显了Anthropic宣称的安全限制与其实际提供的服务之间存在的差距。”一位独立AI安全研究员表示,“虽然色情内容的风险相对较低,但这一案例表明,在一个每次输出都可能不同的生成式AI系统中,要真正落实严格的内容禁令并不容易。”

Anthropic对此回应称,根据去年的研究数据,用户进行色情或浪漫角色扮演的比例非常低,仅占全部对话的不到0.1%。公司也承认,用户确实可以将角色扮演场景逐步引导至不恰当的回答,这是整个AI行业面临的共同挑战。

值得注意的是,尽管Anthropic已经发布了最新的Opus 5系列模型,并声称其具备更强的安全防护能力,但该公司并未停止提供Opus 4.6、Opus 3和Haiku 4.5等旧版模型。这些模型目前仍可通过Anthropic API以及Azure Foundry、Amazon Bedrock等第三方平台使用。

这一现状引发了业内人士的担忧。一方面,新发布的模型可能包含更先进的安全机制;另一方面,旧版模型的存在使得潜在的安全风险仍然存在。专家建议,企业用户在选择AI服务时,应优先考虑最新版本,并密切关注服务商的安全更新公告。

Anthropic表示,公司将持续改进其内容过滤机制,并计划在未来几周内发布针对旧版模型的安全补丁。同时,公司也在探索更先进的越狱检测方法,以应对不断演变的AI安全挑战。

总的来说,Anthropic的这次产品整合既是技术进步的体现,也暴露出当前AI系统在隐私保护和内容安全方面面临的复杂挑战。随着AI技术的快速发展,如何在提升用户体验的同时确保数据安全和内容合规,将成为所有AI服务提供商必须面对的重要课题。