三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

数百万本书,被Claude“阅后即焚”

时间:2026-08-03人气: 作者: 佚名

数百万本书,被Claude“阅后即焚”(图1)

存有诸多内容的厚书被推送进依靠液压驱动的切纸机之中, 压板随后落下来, 锋利的刀片紧接着进行切下这本较厚书籍册的纸张的操作, 书脊由此被十分干脆且利落的方式削除掉, 本来相互连接在一起的书页最终因而变成整齐排列的一沓纸张。

若不存在丝毫解释, 目睹这么一段视频, 你甚至于或许会觉着“产生舒坦之感”、极为缓解压力、舒畅身心。

数百万本书,被Claude“阅后即焚”(图2)

然而要是跟你讲, 有这样一些AI公司, 它们正在借助这套方式, 对纸质书籍展开成批的处理操作, 而这些纸质书里面, 很有可能涵盖了冷门书籍以及绝版书籍, 估摸你八成便会觉得不舒坦了。

AI公司为了寻觅更多训练数据, 先是从公开互联网找起, 而后找到了盗版电子书, 接着一路寻到了现实世界里的纸质书。其中, 2022年以前出版的那部分书, 因既没有混入AI生成内容, 又没有经过现代数据投毒工具处理, 所以成了难得的“上品”。

那些在网上搜索不到的书, 那些不存在电子版的书, 那些冷门的书, 那些绝版的书, 它们能够供应互联网抓取不到的内容, 这般的书更是“上上品”。

被曝光的“巴拿马计划”中明确说不希望外界知道。

有图书数据库公司对外公开声明, 其能够承接业务, 为AI公司寻觅书籍, 能够从旧书店、图书馆以及绝版书目录之中, 一次性采购数量在1000本至100万本之间的纸质书籍, 并且会借助保密协议隐匿买家身份以及采购书目。

AI公司也知道这事儿“不好看”。

01

“巴拿马计划”

纸质书被AI公司盯上了, 起初是在一场官司中, 端倪才得以显现出来的, 最早竟然是这样的情况。

2024年8月, 有三名作家, 他们把它告上法庭 , 指责它未经授权 , 还使用他们的作品对其进行训练了 , 这种行为是不被允许的。

平实地讲, 这种争议实际上从弄出个开端起就未曾停止过, 丝毫没有新鲜感, 相似情形的官司已然出现了好些。

所存在的争议是, AI公司将整个人类互联网抓取过去用以训练模型, 这样究竟算不算侵权行为, 作者所著的书籍进入了训练集, 是否需要经过本人同意, 并且支付版权费用?

所以在这场官司里,纸质书一开始压根不是主角。

想要懂得更多从而写得更好之际, 先把公开的互联网进行了一番扫描。然而网页之中的内容好坏不一 , 所以经过作者创作、编辑挑选以及出版社校对的书被视作关注对象了。

最方便的办法,当然是直接找电子书。

源自法庭的相关材料表现出, 曾存在从、以及等资源库这类范畴里头实施了超过700万本书籍的下载行动。而这些书籍范畴内在相当大一部分是自盗版网站那里来。该公司并非是在使用过之后就予以删除, 反而是将这些文件存放进一个准备作长时间留存的“中央图书馆”, 其目的是用以供给未来的模型训练以及研究能够持续加以运用。

随后, 有一个工程启动了, 其内部代号是“巴拿马计划”。这个计划, 简单来讲, 就是进行大规模纸质书的购买, 接着扫描这些纸质书, 然后用扫描后的内容去喂养AI。

作者声明:该图片由AI生成

数百万本书,被Claude“阅后即焚”(图3)

然而于那个时候, 法庭切实注重的是, 获取以及运用这些内容的途径是不是合乎法律规定。

2025年6月, 有一位名为威廉·阿尔萨普的法官,给出了一套带有对某方面相当有利性质的判断。

在他的视角之下, 大模型去读取一本书籍, 并非是为了朝着用户去复述或者用来出售该书, 而是要从这本书里学习语言, 学习知识, 学习表达方式, 进而生成全新的内容。这样的一种用途具备很强的“转化性”, 与人读过一本书之后获取知识, 然后再去进行创作存在些许相似, 因此在合理使用的范畴之内是能够这样子去认为的。

到了关于那些花钱购置来的纸质书籍的情况, 已然针对每一本倾付过款项。公司当对一本实施扫描操作之后, 就会做毁掉与之对应的实体书籍之举, 仅仅是于内部留存下一个数字形式的替代物, 并未额外制造出一份能够拿到市场上去售卖的复本。鉴于此, 法官判定, 这一环节同样不存在侵犯版权的情形。

但是那700多万本从盗版资源库下载的电子书就说不过去了。

法官觉得, 训练模型也许归为合理使用范畴, 然而却没办法反过来证实盗版获取同样是合法的。你看使用书是一种情况, 至于这本书究竟是通过何种方式到你手上的, 那又是另外一种情形了。

在美利坚合众国的法律体系当中, 判例所具备的作用是颇为巨大的, 这位法官所做出的判例, 为人工智能公司开辟了一条道路, 此道路即为, 人工智能公司能够对人类所撰写而成的作品展开学习, 其前提条件是, 要首先运用合法的方式将作品获取到手。

然而能够瞧见, 于过往的纠纷中, 尽管将所购纸质书予以扫描的行径已然众人皆知, 不过法庭和公众的关注点却偏偏更多聚焦于, 翻来覆去总讨论的关于“运用人类知识去训练AI的法律界限”方面。

直到今年,两篇报道接连出现,大家才突然意识到问题的严峻性。

02

绝版纸质书永远消失?

今年1月, 《华盛顿邮报》, 从4000多页刚刚得到解禁的法庭材料当中, 挖掘出了“巴拿马计划”的更多具体细节。

耗时约一年, 投入数千万元美金, 购得数百万册纸质书籍。供应商切除书脊, 将四散的书页送入高速扫描仪, 随后把剩余纸张交予回收公司。单一份项目计划, 便安排半年内处理五十万至两百万册书籍。

规模已经足够惊人,内部文件里的两句话更要命:

巴拿马计划, 是我们展开的行动, 此行动针对全世界所有书籍, 且是进行破坏性扫描的。

“我们不希望外界知道我们正在做这件事。”

这两句话放在一起,整件事就很难看了。

作者声明:该图片由AI生成

数百万本书,被Claude“阅后即焚”(图4)

一向着重于AI安全、道德以及责任, 然而最终暗暗地开启了一项致使数百万本书籍被毁灭的隐秘工程。

裁切书籍原本能够定义成一种致力于提高效率的扫描形态, “不想使外围获悉”这般情形非常容易让人有猜忌:自身也理解, 这次事件倘若公之于众, 肯定是难以站住脚的。

到底偷偷毁了多少书?

《华盛顿邮报》未能获取完整书目, 外界亦不清楚书里有多少属于随处可见的畅销书, 又有多少已停止重印。人们对工业化切书规模感到震惊, 且很难判定其究竟造成了何具体损失。

在半年之后,有一篇来自404 Media这样的报道, 它将担忧专门聚焦在了绝版书这个对象身上。

称被报道的主角是, 一家声称有着全球最大图书数据库的公司, 它于官网之上, 面向AI客户公然售卖纸质书采购服务, 断言每次能够采购1000直到100万本书, 其货源涵盖旧书店、图书馆以及绝版书目录。

公司居然将保密当作卖点来宣传, 具体表现为, 针对每个项目, 都会签订十分严格的保密协议, 在协议约束下, 客户的身份信息, 采购的策略以及目标书目, 这些内容都绝对不会被披露。

更为讽刺的是, 明明自己心里也清楚, 这门生之见解是见不得阳光的。它于宣传之际, 直接向客户发出提醒: “AI公司毁掉200万本书”, 此般内容决然不是那种能够博得同情的新闻标题。

另外有一点是十分有意思的, 人工智能公司在最近这段时间, 格外喜欢二零二二年以前出版的纸质书籍。

十分容易理解的缘由是这样的: 在生成式AI出现爆发态势以后, 网络上掺和进很多AI生成的内容, 并且存在有人蓄意运用数据投毒工具对模型训练实施干扰的状况。与之形成对比的是, 在2022年以前出版的纸质书籍, 几乎能够明确是由人类来进行写作的, 经历了编辑、校对以及出版等一系列流程, 同时也未曾被现代投毒工具予以处理过。

AI公司亲自制造出了数量越来越多的网络垃圾, 而后又转过头去寻觅未曾被AI污染的旧书。

传到二手书市场的这股需求, 一名专营稀有及低流通量图书的书商告知404 Media , 自今年4月起, 他所处理的订单, 从每周大约20本, 猛然增加到数百本。被买走的书, 主题繁杂, 语言各异, 彼此间几乎不存在联系, 其唯一的共同点, 是皆有ISBN编号。

这位书商没办法确定买家是不是AI公司所指之人, 然而他存有数目可观的外文书籍, 还有不太热门的书籍, 以及已经不再印刷的书籍。

他在一方面借助那些订单, 将多年以来都卖不出去的库存给清理掉了, 而与此同时, 他又极其不太舒服, 表述道: “对于这些书本最后的用途我并不心生喜欢之情, 并且对于那些不经常出现的书本被当作纸浆处理这种情况, 我同样不喜欢。”在正如同前文所讲述的情形那样, 智能的人工智能公司对其扫描纸质书籍的流程是相当简单直接且毫不细致的, 这样的状况使得生意逐渐越来越好的二手书籍商人们也不由自主地在内心之中产生出疼惜之感。

AI 公司寻找训练资源的触角, 先是从互联网开始, 再波及盗版电子书, 之后伸向甚至能批量买来的纸质书, 不断向外延伸。如今, 就连冷门书籍乃至绝版书也没能避开这种情况。

已经绝版的书籍, 它不意味着就一定是孤本。即使当今现在, 也不存在任何证据, 能够用来证明, 世界上某一本书的最后那一册, 已经被人工智能的公司给销毁了。

看不到外界的采购清单, 不清楚哪些公司正处于买书的行为当中, 更无从晓得在书本被送到切割机面前以前, 是否曾有人对其剩余的册数做过检查之事。

但风险是显而易见的。

03

极其有限的退让

2025年的判例(至少在美国范围)已经给了一定的法律保护。

法官有种看法, 认为以合法方式买下一本纸质书籍, 接着把它扫描成为数字文件后, 再将纸质原本予以销毁, 最终的结果竟是只有一份副本留存。此数字文件未曾在对外的渠道进行出售, 并且即便从市场流通数量的角度而言, 同样并未使其有所增加, 这一行为就好比是用一种格式去替换另外一种格式, 从而在这样的情形下, 是能够构成合理使用这一状况的。

依从如此这般的逻辑, 将书裁切, 甚至跃升为用以证明具备合法性的其中一个环节。原本的书籍持续留存于之上, 手中又额外增添了一份数字版本, 这样子便极有可能牵涉到未经许可的复制行径;把纸质书籍予以销毁, 仅仅保留数字文档, 法律层面的风险反倒更低一些。

康奈尔科技学院, 有一位身为数字与信息法教授的 James, 他觉得, 舍弃盗版书库不再使用, 进行更换作出购买、扫描纸质书这样的行为, 这算得上是一个“聪明的选择”, 还能够体现出一种向着更加克制、符合法律规定方向去做的做法。

毁掉纸质书这一行为, 对于一本已经印了几十万册的畅销书来讲, 实际上问题并不会显得有多尖锐, 而少掉一册这件事根本不会对其余人持续进行阅读行为以及购买行为产生影响。

然而, 那些书是冷门的, 是已经绝版的, 并且带有特殊的历史留下的痕迹, 明显是不可以用这样的方式来进行计算的。

澳大利亚与新西兰古旧书商协会主席Dawn表明, 古旧书的价值并非仅仅存在于印出的正文之中, 书页上边存有亲历者留下的批注, 能证明其流传经历的签名、题赠以及历任收藏者的信息, 而且重新装订的封皮里头没准暗藏着更早的手稿。

哪些信息, 全都依附于, 那唯一的一本, 特定的书。就算书页之上的文字, 已然完成扫描, 然而原本的纸张, 以及装帧, 包括各部分相互之间的关系, 一旦遭受破坏, 那么后人, 便不能够重新进行检查。

换句话讲, 有那么一个AI公司, 它获取到了一份对训练模型适宜的数字文件, 然而呢, 却极有可能致使一件单单依靠数字文件没办法完整修复还原的实物遭受到破坏。

争议扩大后,科技行业很快出现了退让。

马斯克于X之上宣称, 已然吩咐团队把稀有书籍放置于图书馆内, 且运用相对更繁杂的无损办法进行扫描, 切不可单纯砍掉书脊。此外, 他并未公开所购书籍的数量, 亦未阐释何种书籍会被界定为“稀有之作”, 此番回应更近似于一种立场方面的表态, 以此表明自身的站队倾向。

数百万本书,被Claude“阅后即焚”(图5)

退让得更快。

404 Media报道发布九天之后, 它把面向AI公司的纸质书采购页面给删除了, 还撤下了有关保密采购的宣传以及破坏性扫描的宣传。公司在这之后改变了说法, 声称相关页面仅仅是一次市场需求测试, 服务从来都没有真正上线过, 并且从来都没有为AI训练去购买过任何一本书, 也没有扫描过任何一本书, 更没有出售过任何一本书。

之前, 宣传出一则, 一次采购一百万本书这么一事, 之后呢, 遇到舆论反弹状况, 此后, 这整个的生意, 陡然变为, “一次测试”, 一种情况, 了。

这番解释能不能让人信服, 这是一回事, 而它起码表明, 匿名给AI公司大规模采购纸质书的行为, 已然变成了企业不想承受的声誉方面的风险。

只不过, 马斯克所做出的一句承诺, 以及删除掉几个网页的行为, 统统都没办法去替代那实实在在存在的真正规则。

究竟是由谁担起在扫描之前去判定一本书是不是稀有的责任? 是依据出版年份、版本以及存世数量来判断, 还是凭借书里的签名、批注以及装帧情况来判断? AI公司是不是应当将大规模采购的书目予以公开? 要是某一本书已然绝版了, 是不是就只能采用无损扫描的方式, 并且在扫描之后交付给图书馆进行保存?

目前,这些问题都没有答案。

具有讽刺意味的是, 在此之前曾反复着重表明, 2022年以前所存在的纸质书籍之所以显得珍贵, 其原因恰恰在于, 它们留存了未曾遭受AI污染的、历经作者创作以及编辑筛选过程的人类知识。而AI公司越是认可这些内容具备不可替代性, 就越发难以阐释清楚, 为何承载着这些内容的实体能够被视作一次性的耗材。

标签: AI   纸质书   版权   扫描   绝版书