就像经典的反乌托邦小说《华氏451度》中的场景一样,一些人工智能公司不仅在阅读书籍——它们正在摧毁书籍。
随着开发者竞相构建更强大的人工智能模型,版权诉讼不断增加,一个小型行业应运而生,向他们提供数百万本被拆解、扫描进训练数据集并被丢弃的实体书籍。
据404媒体首次报道,人工智能公司正通过中介匿名以工业规模获取书籍。专注于批量采购的公司宣传自己能够定位数十万本书籍,同时承诺对人工智能客户保持保密,反映出这一做法的敏感性。
批评者表示,这场购买狂潮是人工智能公司在竞相保护人类创作的知识,以免其被通常称为“人工智能杂质”的生成文本稀释所驱动的。在2023年生成型人工智能兴起之前出版的书籍尤为珍贵,因为它们提供了完全由人类撰写的高质量训练数据。
需求激增已经重新塑造了二手书市场。一位匿名书商告诉404媒体,在人工智能买家进入市场后,周销售从大约20本跃升至几百本。尽管销量的增加带来了利润,但他说他担心那些不常见和绝版的书籍在被扫描和销毁后将永久消失。
“这在经济上对我有利,同时也清理了不太可能出售的旧库存,”这位书商告诉404媒体。“我库存中有来自海外和外语书籍的货品,非常适合这些销售。另一方面,我不喜欢最终的用途,也不喜欢不常见的书籍被制成纸浆。”
这一做法与Anthropic的“巴拿马计划”相似,该计划通过破坏性扫描数字化了数百万本书籍。
去年夏天,在版权诉讼Bartz诉Anthropic PBC案中,旧金山的一名联邦法官裁定,将合法购买的实体书扫描为数字副本,即使原件被销毁,也构成了变革性的合理使用。之后,联邦法官在涉及OpenAI和Meta的单独版权案件中也发布了类似的合理使用裁决。
然而在另一起案件中,本周同一地区的一名联邦法官批准了一项$15亿的版权和解,要求Anthropic支付数千名作者每本约3000美元的赔偿,因为该公司使用了他们作品的盗版副本来训练Claude。
面对日益加剧的反对声浪,包括埃隆·马斯克在内的人工智能开发者发声反对这一做法,并表示公司应该保留被扫描的书籍。
“我已经要求SpaceXAI团队保留任何稀有书籍在图书馆中,并以传统方式扫描它们,而不是简单地切断书脊进行扫描,”马斯克在X上写道。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。