一觉醒来,世界发生了什么?2026.7.29

发布者:唐山乌木 2026-7-29 10:10

今天我们重点关注第3条简讯:多家AI公司被曝正大规模收购纸质二手书以训练AI模型,同时避免引发公众舆论反弹。

这事儿还得从2024年初说起,当时美国人工智能公司Anthropic在内部启动了代号“巴拿马计划”的行动。据后来在版权诉讼中解封的内部文件,计划被描述为“我们为破坏性扫描世界上所有书籍所做的努力”,并特别注明“我们不希望外界知道我们在做这件事”。该公司花了数千万美元,从二手书商批量购入数百万册纸质书。工作人员使用液压切割机切断书脊,将散页送入高速工业扫描仪,完成光学识别后,原书被送去回收或直接销毁。这一过程大约在一年内完成,目标是为Claude等模型提供高质量训练文本。

2025年,多名作者起诉Anthropic,指控其未经授权使用受版权保护的材料。当年6月,美国联邦法官威廉·阿尔苏普作出关键裁决:对于合法购买并随后销毁的纸质书,其扫描与训练用途属于“合理使用”,因为行为具有充分的转换性,且公司并未公开传播数字副本;但对于从LibGen等影子图书馆下载的约700万册盗版电子书,则不构成合理使用。最终,Anthropic针对盗版部分在2025年以15亿美元(约合人民币101.7亿元)达成和解,但破坏性扫描纸质书却被法院认可为合法。这一判决成为关键先例,直接鼓励了后续的行业行为。从一家公司的内部秘密项目,演变为整个行业正在扩大的系统性做法。

到2026年,随着互联网上的“AI垃圾”急剧增加,模型若继续在污染数据上训练,会出现所谓“模型崩溃”的风险——性能退化、输出越来越同质化。于是,多家人工智能公司将目光投向2022年以前出版的纸质书:这些文本由人类撰写、编辑,几乎不可能包含AI生成的内容,且结构完整、权威性高。ISBNdb这类原本服务于图书馆与书商的数据库公司(注:其自称为“世界上最大的图书数据库”和ISBN API提供商,拥有超过1.11亿本图书记录),公开推出面向大语言模型训练的批量书籍采购服务,单笔订单可达100万册,并强调严格保密协议,理由也很直白:“‘人工智能公司销毁两百万本书’这种标题不会赢得同情。”

欧洲的二手书商嗅到不寻常:从德国、荷兰、西班牙到瑞士,夜间自动订单激增,买家来自北美,目标是那些冷门、专业、商业价值极低的绝版或稀有书目,然后大批量运往美国芝加哥附近的物流中心处理。

总的来说,这事儿的背景是数据饥渴与法律套利的双重驱动。互联网公开文本已被反复爬取,高质量人类写作成为稀缺资源,而中间商的出现,则是为了把公司名称从订单上抹去,避免公众把“销毁书籍”与“焚书”的文化禁忌挂钩造成负面影响。

大家都在看

相关文章