Anthropic 被控拆解絕版書以及下載盜版書用以訓練 AI 模型。(圖/路透社)
美國人工智慧公司 Anthropic 旗下大型語言模型 Claude 捲入集體訴訟案,使用盜版書籍進行訓練涵蓋約 50 萬部受著作權保護的作品,同時更曝光 Anthropic 花費數百萬美元購買大量紙本書籍,拆除書脊、逐頁裁切掃描後銷毀原書,目前 Anthropic 已同意支付高達 15 億美元的和解金。
訴訟指控 Anthropic 從創世紀圖書館(Library Genesis)及 Pirate Library Mirror 等平台下載書籍,用於其 AI 模型的訓練,先是於 2021 年下載 Books3 資料庫,內容包含 196,640 本未經授權書籍,隨後又從 LibGen 下載至少 500 萬本書籍,2022 年再取得至少 200 萬本內容,累計超過 700 萬本來自未經授權的盜版網站。
請繼續往下閱讀...
而且 Anthropic 內部清楚來自盜版網站的資料可能帶來法律風險,依然選擇保留這批資料,且並非一次性的 AI 訓練資料,而是規劃建立永久保存的中央圖書館,法院指出,數百名工程師都可存取這些內容,甚至能建立額外副本供其他用途使用。
判決中指出,Anthropic 為建立 AI 訓練資料,原本希望取得更多合法內容,甚至提出建立「世界上所有書籍」資料庫的構想,但授權結果不如預期,隨後改以大量購買紙本書方式,投入數百萬美元購買大量紙本書籍,再委託第三方拆除書脊、裁切每一頁並掃描為數位檔,
美國加州北區聯邦法院認為,若公司合法購買紙本書,再將內容一對一數位化供 AI 訓練使用,即使紙本遭銷毀,仍可構成合理使用,但來自盜版網站下載超過 700 萬本書籍,並建立永久保存的中央圖書館,已超出合理使用範圍。突顯全球 AI 發展中對內容著作權保護的重視。
標題:下載盜版書籍訓練 AI 模型!Anthropic 賠 15 億和解 判決內容公開
地址:https://www.twetclubs.com/post/146532.html