三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

珍稀图书遭粉碎用于 AI 训练引众怒,ISBNdb 下架AI相关测试页面

时间:2026-08-02人气: 作者: 佚名

本周, 一则消息引发了读书爱好者以及普通网友的广泛关注, 消息内容是关于大量珍贵图书被集中粉碎, 其目的仅仅是为训练大语言模型(LLM)提供数据, 这是 IT 之家 8 月 2 日发布的。

珍稀图书遭粉碎用于 AI 训练引众怒,ISBNdb 下架AI相关测试页面(图1)

有消息表明, 近期一些图书供应商收到图书订单, 订单数量异常庞大。业内有些人猜测, AI公司想要获取质量更佳、更深净的训练数据, 并且要在尽可能最大程度上规避版权产生的风险。而这场争议聚焦的重点, 是指向图书数据库类型的网站。外界有人觉得, 这个网站不但鼓励这种行为, 甚至于还在两者之间助力牵接连系。伴随舆论很快发酵, 开始想要跟这场争议划清界限, 还消除了自己之前发布的相关内容。

在最近的声明里作出表达: “针对网站上那一番市场需求测试引发的担忧。我们留意到近期有一则关于网站之营销落地页涉及, 理解其所引致之忧虑。而我们并不开展 AI 模型之训练, 也从来没有从事过与之相关之种种业务。那一个页面仅仅只是一次市场需求测试情形, 相关服务从来都没有真正上线启用, 当前我们已然把页面予以删除。”。

日前, 404媒 体有报 道称, 多家图书提供方忽然收到大批图书采买订单, 鉴于学校以及图书馆近些年来预算紧张且采购需求降低, 诸多供应商面临的经营压力较大, 所以更易于接纳这类大额订单。

在那时候, 外界广泛都在怀疑, 幕后买家是AI公司, 而它, 就得以成为舆论聚焦之点, 借助于它曾经推出过一项服务, 好像是专门去协助AI企业跟图书仓储机构构建起联系的缘故。

曾经在如今已然被删除的宣传页面之上, 有着这样的表述: “那摆放在书架之上的, 乃是世界上最为优质的AI训练数据。图书所承载的, 是历经筛选、同行评审以及专业领域沉淀的人类知识, 其结构化程度, 是任何网络爬虫都没有办法去复制的, 内容密集, 经历过编辑, 并且具备权威性"

实际上, 此一行为并不是头一回被曝光, 往早了说, 就在今年1月的时候, 有一份公开呈现的法庭文件, 它揭露了一个内部有着代号为“(巴拿马计划)”的项目, 这个项目的目的在于尽最大可能去购置数量众多的图书, 在完成数字化扫描之后, 再把实体书给毁坏掉。

此后, 与作者达成了一项和解协议, 该协议总额为15亿美元, IT之家注: 现汇率约合101.47亿元人民币。不过, 随后法庭文件公开显示, 这种做法本身被认为是合法的, 真正让公司担忧的, 是由此带来的负面舆论。因此, 愿意支付高额代价, 为的是避免相关做法被曝光。

当下, 此内幕已被公开, 所以近来显现的众多珍贵图书采购订单也被予以了更为严格的留意。

一位隐匿姓名的图书售卖者,在接受404 Media媒体的访谈之际宣称, 如此运作, 一方面能够协助我去清理那些原本就极度难以实现销售的库存情形, 另一方面还恰好可以使我获取到钱财收益。然而在另外一个层面而言, 我对这些图书最终所达成的用途并不抱持喜爱之情, 同时内心也不想目睹一些珍稀罕见的图书被径直处理成纸浆的这般状况。

据报道称, 因AI公司获取“干净”的训练数据愈发困难, 所以它们正寻觅新的数据来处。

互联网之中存在着大量质量不高的内容, 还有更多由人工智能自身生成的内容, 这些全都有可能致使模型训练出现“负反馈循环”这样的问题。所以, 各个公司期望获取质量更为高的数据, 与此同时还要尽力避免引发外界的关注。

到了今年的那个夏天, 电影公司A24预告了要跟谷歌达成合作, 为其供应那种训练素材, 期望能助力它的媒体生成模型摆脱众多质量低级、风格紊乱的AI 内容。

关于为什么要把实体书给销毁掉, 报道给出的看法是, 这并非是为了去将痕迹进行掩盖, 也不是因为有着收藏稀有知识这样的目的。

那些关于“巴拿马计划”的相关文件里头, 并没有描绘出销毁图书的具体缘由, 然而最有可能的一种解释, 依旧是想去降低成本。其实, 图书进行数字化扫描这件事情, 不一定势必要把原书给破坏掉, 可是要是整个流程都在追求低成本还有高效率的话, 那就极有可能直接去拆掉书脊, 目的是为了能够获取到更平整、更清晰的扫描效果, 之后, 再把已经损坏掉的书籍当作废纸予以处理。