为了训练AI,Anthropic把数百万本书“切了“

📅 发布时间:2026/8/3 21:51:45
为了训练AI,Anthropic把数百万本书“切了“
一本厚书被推进液压切纸机压板落下刀片切下书脊被干脆利落地削掉。原本连在一起的书页变成一沓整齐的纸张。如果没有任何解释看到这样的视频你可能还会觉得挺解压。可如果告诉你AI公司正在用这套办法成批处理纸质书其中还包括冷门书和绝版书相信你八成就舒服不起来了。这就是最近在科技圈炸开的一个话题为了让AI学会读更多的书Anthropic——做Claude那家公司——被曝出大规模购买纸质书、切掉书脊扫描进电脑、然后把实体书销毁。内部代号叫巴拿马计划。这个故事有点复杂但也特别值得普通人都看懂。AI为什么盯上了纸质书你可能已经知道AI大模型是靠读海量内容练出来的。过去这几年AI公司把整个互联网都抓去喂给模型了后来又盯上了盗版电子书。但问题来了互联网上的内容良莠不齐而且自从生成式AI爆发以后网上混进了大量AI自己写的东西还有人故意用工具投毒干扰训练。相比之下2022年以前出版的纸质书几乎可以确定是人类一个字一个字写的经过作者写、编辑改、出版社校质量有保证也没被污染过。对AI公司来说这些旧书是难得的好原料。数据越干净模型学得越好。而那些网上搜不到、没有电子版的冷门书和绝版书能提供互联网上抓不到的内容更是AI眼中的上上品。问题是这些书大多没有电子版怎么办很简单——买纸质书自己扫描。巴拿马计划一边切书一边保密其实AI公司买纸质书扫描最早的苗头是Anthropic惹上的一场官司。2024年8月三名作家把Anthropic告上法庭说它没经过同意就用他们的书训练Claude。这类官司从ChatGPT火起来就没停过一开始纸质书并不是焦点——争议更多在用人类知识训练AI算不算侵权上。但法庭材料越挖越深一个叫巴拿马计划的内部工程浮出水面。简单说就是Anthropic大批量买纸质书、扫描、喂给AI然后销毁实体书。规模有多大一年左右的时间里Anthropic花掉数千万美元买下数百万本纸质书供应商把书切掉书脊散页送进高速扫描仪剩下的纸张交给回收公司光一份项目方案就计划在半年内处理50万到200万本书它还从Books3、LibGen、PiLiMi等资源库下载了超过700万本电子书相当一部分是盗版的存进一个长期保留的中央图书馆真正让人不舒服的是Anthropic内部文件里的两句话巴拿马计划是我们对全世界所有书籍进行破坏性扫描的行动。我们不希望外界知道我们正在做这件事。一家天天把AI安全、道德、责任挂在嘴边的公司背地里却在搞一项毁掉几百万本书的秘密工程。第一句还能解释成追求效率第二句就怎么也圆不回去了——你自己都清楚这事见不得光。绝版书可能真的没了就没了有人可能会说畅销书印了几十万册少一本怎么了这话对畅销书成立但对冷门书、绝版书、带历史痕迹的书完全不成立。古旧书收藏圈的人指出一本旧书的价值不只在印出来的文字上。书页上可能有前主人留下的批注、签名、题赠封皮里甚至可能藏着更早的手稿。这些信息都依附于那一本具体的书。AI公司得到了一份适合训练的数字文件却可能毁掉了一件永远无法通过数字文件还原的实物。即使文字扫描下来了原来的纸张、装帧、批注之间的关系一旦被破坏后人就再也看不到了。更让人担心的是这股买书需求已经烧到了二手书市场。一名专营稀有图书的书商说从今年4月开始他每周处理的订单从20本左右猛增到数百本被买走的书主题杂乱、语言不同唯一的共同点是都有ISBN编号。他一方面靠这些单子清了多年卖不掉的库存另一方面又不舒服我不喜欢这些书最后的用途也不喜欢那些不常见的书被打成纸浆。还有图书数据库公司ISBNdb公开宣称能帮AI公司找书从旧书店、图书馆和绝版书目录一次采购1000到100万本还用保密协议藏住买家身份。讽刺的是它自己都提醒客户AI公司毁掉200万本书可不是什么能赢得同情的新闻标题。法律上也许合法但失掉的是信誉那这么做到底犯不犯法2025年6月处理Anthropic官司的法官阿尔萨普给了一个对AI公司相当有利的判断AI读一本书不是要复述或卖这本书而是从中学习语言和知识再生成新内容这种用途转化性很强类似人类读了书获得知识再去创作可以算合理使用。至于纸质书Anthropic是合法买来的扫描一本就销毁对应的实体书只留一个数字替代品没多制造一份投到市场上去。法官认为这也算合理使用。有意思的是按这套逻辑切书甚至成了证明合法的一环——如果不销毁原书Anthropic手里就多了一份副本反而可能侵权销毁了就只剩一份数字版法律风险更低。有法学教授甚至说Anthropic放弃盗版书库、转而去买纸质书扫描是聪明的选择。但法律归法律人心是另一回事。舆论炸锅之后科技圈很快出现了退让马斯克在X上表态已经要求SpaceXAI团队把稀有书保存在图书馆改用更麻烦的无损方式扫描不能简单切掉书脊ISBNdb在报道出来9天后删掉了面向AI公司的纸质书采购页面改口说那只是个市场需求测试从没真正买过书这些退让都说明一件事帮AI公司批量毁掉纸质书已经成了任何企业都不愿背的声誉包袱。最后的讽刺整件事最讽刺的地方在于AI公司之所以这么看重2022年以前的纸质书正是因为它们保存了没被AI污染、纯粹的人类知识。AI公司越想证明这些内容不可替代就越难解释——为什么承载这些知识的实体书可以被当成一次性耗材谁来判断一本书扫描前算不算稀有判断依据是出版年份、存世数量还是书里的签名、批注AI公司该不该公开大规模采购的书目绝版书是不是只能无损扫描、扫完交给图书馆保存这些问题目前都还没有答案。而在这场关于技术进步与文明传承的拉锯里那些被切掉书脊的书不会再回来了。文中所用图片来源于网络仅供技术学习与交流。如权利人认为存在侵权请联系我们我们将在24小时内处理。