AI公司大规模采购纸质书,200万本旧书被切脊扫描
在人工智能领域快速发展的今天,一家硅谷公司正在采取一项引人注目的行动:大规模采购并销毁纸质书籍。据最新披露,美国人工智能公司Anthropic(开发了Claude系列模型)已启动代号为“巴拿马计划”的...
在人工智能领域快速发展的今天,一家硅谷公司正在采取一项引人注目的行动:大规模采购并销毁纸质书籍。据最新披露,美国人工智能公司Anthropic(开发了Claude系列模型)已启动代号为“巴拿马计划”的项目,通过购买、拆解和数字化的方式,将大量实体书籍转化为下一代AI模型的训练数据。
这项计划的核心在于获取高质量的原始文本数据。随着生成式AI技术的普及,互联网上的内容越来越多地受到AI生成内容的影响,导致训练数据的质量下降。相比之下,2022年以前出版的纸质书籍被视为“干净”的数据源,因为这些书籍的内容尚未被AI生成内容所污染。
根据法庭文件显示,Anthropic在2024年的一年内花费数千万美元,从全球二手书市场批量采购了约200万本实体书籍。这些书籍经过液压切纸机去除书脊后,由高速扫描仪将其转化为可搜索的数字版本,而纸质原件则被作为废料处理。
这一做法引发了广泛的争议。一方面,支持者认为这是AI发展过程中不可避免的步骤,有助于构建更准确、更可靠的人工智能系统;另一方面,批评者则担忧这可能导致珍贵的实体书籍永久消失,特别是那些绝版或稀有的初版书籍。
值得注意的是,尽管表面上看是“销毁”书籍,但实际上这些书籍的内容已经被完整保留下来,并用于训练AI模型。法官威廉·阿尔索普在相关判决中指出,这种行为属于合理使用,因为每本纸质书籍都被一对一地转换为数字副本,且原件已被销毁,不会增加副本数量。
“我们正在收集人类文明的训练集。”Anthropic首席执行官达里奥表示,“这些书籍包含了数百年来人类积累的知识、经验和思想,是我们构建下一代AI系统的重要基础。”
然而,这一计划也引发了关于版权和文化遗产保护的讨论。一些作家和出版商担心,这种大规模的数据采集可能会影响未来的版权法规,甚至威胁到传统出版业的生存。
“这不是简单的销毁书籍,而是对人类知识的一种重新定义。”科技评论家李明指出,“我们需要思考如何在推动AI发展的同时,保护好我们的文化资产。”
目前,Anthropic已经完成了大部分的书籍扫描工作,预计将在未来几个月内完成所有数据的整合。这项计划不仅展示了AI公司在数据获取方面的决心,也反映了当前AI技术发展面临的挑战——如何在海量数据中找到真正有价值的信息。