Is it legal to train AI models on copyrighted books? It』s complicated: 用版權書訓練AI合法嗎?

Is it legal to train AI models on copyrighted books? It』s complicated: 用版權書訓練AI合法嗎?

Olivia Hughes
138
original

生成式AI的訓練資料中包含了海量受版權保護的書籍, 作者們不知情也未同意。近期Anthropic案被判15億美元賠償, 但法院認定訓練本身合法, 非法的是盜版來源。本文梳理這場複雜的法律博弈及其影響。

大約每個寫過書的人都可能已經成了AI訓練資料的「貢獻者」,只是本人不知道。ChatGPT、Gemini、Claude這些聊天機器人的背後,模型從數以億計的書籍、文章、論文裡學會了語言。對於作者來說,這像是一場無遮無掩的「借用」——自己的作品被拿去餵給了將要取代自己的工具。這種感覺當然很糟糕。

但糟糕歸糟糕,法律上這事遠沒有一句「這就是侵權」那麼簡單。專注於智慧財產權與網際網路法的律師Cathy Gellis對媒體直言:這個領域裡「有太多的事情同時發生」,有大量情緒化的爭論,但也有技術上的殘酷現實。

「合法但罰了15億」的裁決

去年的一起案件成了標誌性事件。法官William Alsup要求Anthropic向一批作家支付高達15億美元的版權賠償。看到這個數字,很多人下意識地認為作者贏了。然而真正讀判決會發現,法官並非認定AI訓練行為非法。

Alsup給出的結論是:Anthropic的模型訓練本身不違法——違法的是模型公司從非法的線上影子圖書館裡把書「偷」出來當訓練資料。換句話說,同樣一本書,通過正規渠道購買後用來訓練可能沒問題;從盜版網站批量下載,就是另一回事。

「像任何渴望成為作家的讀者一樣,Anthropic的大語言模型訓練並不是為了搶先複製或取代作品,而是為了轉過一個艱難的彎,去創造不同的東西。」——法官William Alsup

這個比喻很有文學味:模型讀了幾萬億詞,跟一個年輕作家埋頭讀文學經典,本質上都是「學習」。雖然作家可能不樂意,但法官至少在這一案上區分了「用內容學習」與「盜版獲取內容」兩個環節。

一張罰單,兩種解讀

律師Gellis認為,這個裁決其實對AI公司更有利。15億美元聽著嚇人,但相對於Anthropic的體量和整個行業的資源,這筆錢更像是「買路錢」。它把爭論的焦點從「能不能用版權書訓練」移到了「從哪裡拿書訓練」。後者可以通過購買正版資料集、獲取授權、甚至建設合法的內容庫來解決。

對作者來說,這個裁決並沒有關閉大門。它承認了「訓練侵權」的路徑,也給了作者們一個談判籌碼:如果AI公司不解決版權問題,就可能面臨鉅額的追償。但與此同時,它也沒有完全否定AI學習的正當性。

這件事意味著什麼

  • 對作者群體:裁決提供了一個先例,證明「以訓練為目的的使用」並非天然違法,但必須有合法的資料來源。如果發現自己作品出現在盜版訓練集裡,起訴的路是通的。
  • 對AI公司:繼續用盜版書訓練風險變大,但通過正規授權或購買資料可以規避最重的罰單。成本會上升,但不會動搖商業模式。
  • 對法律界:這只是一系列類似訴訟的開始,後續判例可能會進一步細化「合理使用」的邊界,尤其是在美國之外。

怎麼看這件事

這不只是一場關於書的爭論,而是整個生成式AI時代的核心問題之一:機器「學習」人類作品,到底算不算侵權?目前來看,答案取決於「怎麼學」。如果你關心創作者的權益,接下來的關鍵不是等待一個「有一方全贏」的判決,而是關注資料來源合規化的程序。那些花錢購買正版訓練資料、主動建立授權機制的AI公司,可能才是這場博弈裡笑到最後的人。

AI訓練版權法生成式AIAnthropic著作權影子圖書館法律與技術AI模型訓練版權爭議大語言模型

分享

評論

0
0/500 字元

暫無評論

成為第一個評論的人

探索更多

相似工具

GeoInfer

GeoInfer

GeoInfer 只憑畫面本身推斷照片拍攝地:借助建築、地形、植被等視覺線索完成識別,無需 EXIF、GPS 或反查圖片。

SharpLines

SharpLines

SharpLines 是 AI 體育預測平台,涵蓋 NBA、NFL、MLB、NHL、NCAA 與足球,多模型輸出比賽預測並對各大博彩線做即時比對分析。

Osmosis

Osmosis 是 HMD Secure Sales Hackathon 2026 展示的 CRM 原型,主張讓線索、案例與預測從聊天中自然抽取,而不是靠人工填表。

GoodMoat

GoodMoat

GoodMoat是一款AI驅動的股票估值工具,它區別於傳統「黑箱」模型,將每個估值數字直接追溯到原始SEC文件,並註明來源和刷新時間。它支持任何股票的完整DCF、反向DCF(判斷市場已定價的增長)以及三種交叉驗證的公允價值模型。其X-Ray功能通過AI深度分析40多項財務指標,將複雜數據轉化為對企業護城河或炒作本質的通俗解讀。所有AI輸出均對照原始文件核查,避免幻覺數字,確保結果可靠。

Q-bit AI pro 2.0

qbitaipro.com 的公開登陸頁僅提供終端登入畫面與一組示範帳號,除了 BTC Futures Engine 的自述外,登陸頁沒有可見的功能清單、團隊介紹、監理揭露或定價,因此本條目只陳述可查核內容,不描述官網未揭露的能力。

Pommy AI

Pommy AI 是一個面向創始人和營銷人員的自動化系統,自動生成、安排並優化社交媒體帖子(reels/shorts)和視頻廣告活動。它學習品牌聲音,設計創意,定位受眾並處理跨平臺分發,幫助用戶以自動駕駛方式擴大增長。

開源專案

Operit: 開源安卓 AI 代理, 連接模型與工具執行真實任務

Operit 是一個開源的安卓 AI 代理, 主要使用 Kotlin 開發。它能夠將雲端或本地模型與系統工具、終端和瀏覽器連接起來, 從而執行真實的用戶任務。該項目在採集時擁有 5669 個 GitHub 星標, 採用 Other 許可證。

OctoBot: 免費開源的Python加密貨幣交易機器人

OctoBot 是一個免費開源的 Python 加密貨幣交易機器人,可在 15 個以上交易所自動化交易策略。它提供回測、紙面交易和 Web 界面,幫助用戶輕鬆管理交易。項目採用 GPL-3.0 許可證,目前(採集時)在 GitHub 擁有 6146 個星標。

Casdoor: 開源 UI 優先的身份與訪問管理平臺

Casdoor 是一個開源的、以 UI 為先的身份與訪問管理平臺,定位為專門的認證伺服器。它通過單一管理界面管理用戶、組織、應用和身份提供商,並支持 OAuth 2.0、OIDC、SAML 2.0、CAS 和 LDAP 等協議。同時提供 WebAuthn、passkey、TOTP 雙重認證、生物識別登錄、SCIM 2.0 配置、基於角色的訪問控制和多租戶組織模型。技術棧採用 React 前端和 Go 與 Beego 後端,可持久化到 MySQL、PostgreSQL 等資料庫。項目以 Apache-2.0 許可證開源。

OpenAlice: 本地AI交易工作空間,採用Git式審查工作流

OpenAlice是一個本地交易工作空間,允許AI編碼代理通過Git風格、審查門控的工作流執行研究、投資組合管理和經紀訂單。項目主要使用TypeScript開發,採用AGPL-3.0許可證,在採集時獲得5201個GitHub星標。

comp: 開源的AI原生合規平臺

comp 是一個開源的 AI 原生合規平臺,可自動化 SOC 2、ISO 27001 等認證流程。作為 Vanta 和 Drata 的自託管替代方案,它降低成本並保護數據安全。基於 TypeScript 構建,提供自動化證據收集、智能策略檢查和風險分析。適合重視數據主權和定製化的中型團隊。

Awesome-LLM4Cybersecurity: 匯總大語言模型與網絡安全交叉資源

Awesome-LLM4Cybersecurity 是一個精選的 GitHub 倉庫,彙編了大型語言模型與網絡安全交叉領域的最新論文、工具、數據集和框架。該倉庫由專家社區維護,據項目描述,已獲得超過 1600 個星標,是安全研究員和 AI 開發者快速了解或追蹤前沿進展的重要資源。項目主要使用 JavaScript 編寫,採用 MIT 許可證。