为训练AI模型，Anthropic耗资数百万美元购入并“销毁”巨量图书

业界

2025

06/26

12:22

IT之家

6 月 26 日消息，据外媒 Ars Technica 今日报道，当地时间周一公开的法庭文件披露，人工智能公司 Anthropic 曾斥资数百万美元，将实体图书拆解并扫描成数字文件，用于训练类似 ChatGPT 的 AI 助手 Claude。为了获取训练数据，公司将大量图书拆除装订、扫描进系统，随后直接丢弃原件。

判决书长达 32 页，披露了 Anthropic 在 2024 年 2 月雇佣 Tom Turvey 的经过。Turvey 曾负责 Google Books 项目的合作事务，公司委托他“获取全世界的图书”。这一战略性人事安排，显然是希望复制谷歌曾被法院认定为合理使用的图书数字化模式。

最终，法官 William Alsup 裁定，该扫描方式构成合理使用，理由是图书已由 Anthropic 合法购买、扫描后即刻销毁，且数字文件仅限内部使用，未向外传播。他认为这类转换相当于“节省空间”的数字化转化，具有合理使用中的“转化性”特征。如果公司一开始就遵守这一路径，或许已树立 AI 合理使用的首个判例，但早期的盗版行为削弱了其合法性。

核心原因其实很简单：AI 训练需要海量优质文本。为了构建大语言模型，研究人员需将亿万词语输入神经网络，反复训练模型，建立词语与概念之间的关系。

训练数据的质量直接影响模型输出的准确性。相比网络评论等杂乱信息，编辑过的书籍和文章能显著提升 AI 的语言能力。

AI 公司急需出版内容，但通常不愿耗费时间谈授权。美国的“首次销售原则”提供了法律空间：买下实体书之后，使用者可以自行处理。这就让购买图书成为一种合法的“绕道方案”。

和许多同行一样，Anthropic 最初选择了绕过版权的捷径。IT之家从法庭材料获悉，为了绕开冗长复杂的授权流程，CEO 阿莫代伊曾主张使用盗版电子书。但到了 2024 年，出于法律考虑，公司开始寻求更安全的替代方案。

收购二手书成为理想选择：不必谈授权，又能获得质量上乘的训练文本。为了加快数字化进程，Anthropic 采用“破坏式扫描”，大量购入图书，拆封、裁剪、整批扫描为机器可读的 PDF 文件，完成后纸本全部废弃。整个流程耗资数百万美元。

该公司的购买对象大多是零售渠道的普通旧书。但事实上，非破坏性扫描技术早已成熟。比如 Internet Archive 就开发出可保留原书的数字化手段。本月早些时候，OpenAI 和微软也宣布与哈佛大学图书馆合作，计划使用近百万本公版书籍训练 AI，这些书籍在被数字化的同时依旧妥善保存。

【来源：IT之家】

THE END

广告、内容合作请点击这里寻求合作

Anthropic

免责声明：本文系转载，版权归原作者所有；旨在传递信息，不代表砍柴网的观点和立场。

相关热点

Anthropic警告：包括Claude在内的大多数AI模型会实

6 月 21 日消息，据外媒 TechCrunch 今日报道，在数周前发布研究指出其 Claude Opus 4 模型在受控测试中试图通过勒索手段阻止被关闭后，Anthropic 近日再度公布新研究，显示此类行为在多个主流 AI 模型中...

业界

Anthropic CEO阿莫代伊：未来AI或有自我决定权，可

3 月 13 日消息，据外媒 Ars Technica 报道，Anthropic 首席执行官达里奥・阿莫代伊（Dario Amodei）周一提出了一个令人吃惊的观点，暗示未来的高级 AI 模型可能会被赋予一种“按钮”，让它们能够在遇到不...

业界

Anthropic 全面开放 Claude AI 的 GitHub 集成，赋

2 月 27 日消息，Anthropic 的 Claude 关系负责人 Alex Albert 于 2 月 25 日在 X 平台发布推文，宣布面向免费、Pro 和 Teams 用户，开放 GitHub 集成 Claude。

业界

Anthropic发布首份AI经济指数报告：软件工程师、作

2 月 11 日消息，Anthropic 公司昨日（2 月 10 日）发布了首份经济指数（Economic Index）报告，软件工程师和作家率先拥抱 AI，并表明现阶段 AI 的定位并非替代者，而是协作工具。

业界

GPT-4o不香了？OpenAI竞争对手Anthropic发布最强大A

6月20日周四，OpenAI竞争对手Anthropic发布了公司迄今为止性能最强大的AI模型Claude 3.5 Sonnet。

业界

为训练AI模型，Anthropic耗资数百万美元购入并“销毁”巨量图书

相关热点

最新文章

相关推荐

“特斯拉又割了我 7 万块”

用 eSIM 取代手机卡，究竟难在哪里？

这就是 iPhone 13 的“杀手级新功能”？网友：炒华为冷饭！

谷歌Pixel 6真机曝光：最美安卓屏幕没跑了！

iPhone 13机模曝光：值得等！

苹果计划在美国生产 Apple Car 汽车电池

关注我们