行业观察 · TechCrunch AI
亚马逊被曝销毁稀有古籍,用于训练AI模型
据TechCrunch报道,亚马逊正在销毁稀有书籍以获取训练数据,用于训练大型语言模型(LLM)。这些稀有书籍因内容独特而极具价值,因为现有模型已几乎用尽了互联网上可获取的文本。此举引发了对版权、文化遗产和AI数据来源的担忧。目前具体细节尚不明确,包括涉及哪些书籍、规模大小等。亚马逊未对此作出官方回应。
原文:TechCrunch AI原文发布:2026/8/17 16:38:44中文发布:2026/8/17 16:41:25
2026年8月17日,TechCrunch报道称,亚马逊——这家最初以在线书店起家、如今业务涵盖云计算和人工智能的科技巨头——正通过销毁稀有书籍的方式,为训练大型语言模型(LLM)获取数据。报道指出,这些稀有书籍对于训练AI模型来说价值巨大,因为现有模型已经大量使用了互联网上公开可获取的文本,而稀有书籍中往往包含独特的历史、文化和学术内容,是普通语料无法替代的。
据称,亚马逊的这项做法可能涉及对稀有文本的扫描或数字化,但报道强调“销毁”一词,暗示了这些实体书籍可能被物理破坏。这种做法引发了多方面的争议。首先,从版权角度看,稀有书籍通常仍受版权保护,未经授权进行复制或使用可能构成侵权。其次,从文化遗产角度看,销毁古旧书籍是对人类知识的不可逆损失,即使已经数字化,也无法完全替代原件的价值。
值得注意的是,亚马逊在AI领域一直有大规模投入,包括其自家的基础模型和云计算服务。然而,通过销毁稀有书籍来获取数据的方式,在行业内尚属罕见。其他科技公司如OpenAI、谷歌等,此前也曾因使用受版权保护的文本训练模型而面临诉讼,但直接销毁实体书籍的报道较为少见。
目前,尚不清楚亚马逊具体销毁了哪些书籍,以及这一行为是否已持续一段时间。TechCrunch的报道未提供明确的数据和内部文件,因此有关细节仍有待证实。亚马逊方面也未就此事发表官方评论。如果报道属实,这一事件无疑将加剧公众对于AI训练数据来源透明度的担忧,并可能引发监管部门的关注。
在AI行业,高质量的训练数据越来越稀缺,尤其是在网络公开内容被过度使用之后。企业开始寻求非传统的数据源,如私人藏书、未公开的档案等。然而,数据获取必须平衡创新与伦理,涉及到文化遗产和知识产权保护时更需谨慎。亚马逊的做法或许反映了一种极端的解决方案,但也为整个行业敲响了警钟:AI的发展不应以牺牲人类共同的记忆为代价。
#AI训练#版权#亚马逊#稀有书籍#大语言模型
查看原始信息来源