0x牛牛
0x牛牛|2026年07月28日 17:04
硅谷AI公司,开始“焚书”训练模型了。 不是把书投入火里,而是更工业化的做法:批量购买纸质书,用液压设备切掉书脊,高速扫描全部页面,再把纸本丢弃或回收。 做这件事的是Claude背后的Anthropic。法庭文件显示,其“Project Panama”曾寻找供应商,计划在6个月内扫描50万至200万本书。公司还请来参与过Google Books项目的前负责人,目标是建立一座可供模型训练和研究的数字图书馆。 原因很讽刺:互联网正在被AI生成内容污染,真正由人类写成、尤其是2022年前出版的纸质书,反而成了最干净、最稀缺的训练数据。 法律上的结果更有意思。 美国法院认为,只要Anthropic合法购买一本纸质书,扫描后销毁原件,用数字副本一对一替代,属于合理使用;但它此前从盗版网站下载的数百万本电子书不受保护。后者最终促成15亿美元和解,约48.2万本书涉及赔偿,每本约3000美元。 人类过去烧书,是为了让知识消失;AI时代“毁书”,却是为了让机器把知识全部吃下去。 真正值得讨论的不是一堆纸去了哪里,而是当人类写作成为稀缺训练资源,谁有权购买、复制并把它变成商业模型的能力。(0x牛牛)
+2
曾提及
分享至:

脈絡

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀