Is it legal to train AI models on copyrighted books? It’s complicated: 用版权书训练AI合法吗?

Is it legal to train AI models on copyrighted books? It’s complicated: 用版权书训练AI合法吗?

Olivia Hughes
138
original

生成式AI的训练数据中包含了海量受版权保护的书籍, 作者们不知情也未同意。近期Anthropic案被判15亿美元赔偿, 但法院认定训练本身合法, 非法的是盗版来源。本文梳理这场复杂的法律博弈及其影响。

大约每个写过书的人都可能已经成了AI训练数据的“贡献者”,只是本人不知道。ChatGPT、Gemini、Claude这些聊天机器人的背后,模型从数以亿计的书籍、文章、论文里学会了语言。对于作者来说,这像是一场无遮无掩的“借用”——自己的作品被拿去喂给了将要取代自己的工具。这种感觉当然很糟糕。

但糟糕归糟糕,法律上这事远没有一句“这就是侵权”那么简单。专注于知识产权与互联网法的律师Cathy Gellis对媒体直言:这个领域里“有太多的事情同时发生”,有大量情绪化的争论,但也有技术上的残酷现实。

“合法但罚了15亿”的裁决

去年的一起案件成了标志性事件。法官William Alsup要求Anthropic向一批作家支付高达15亿美元的版权赔偿。看到这个数字,很多人下意识地认为作者赢了。然而真正读判决会发现,法官并非认定AI训练行为非法。

Alsup给出的结论是:Anthropic的模型训练本身不违法——违法的是模型公司从非法的在线影子图书馆里把书“偷”出来当训练数据。换句话说,同样一本书,通过正规渠道购买后用来训练可能没问题;从盗版网站批量下载,就是另一回事。

“像任何渴望成为作家的读者一样,Anthropic的大语言模型训练并不是为了抢先复制或取代作品,而是为了转过一个艰难的弯,去创造不同的东西。”——法官William Alsup

这个比喻很有文学味:模型读了几万亿词,跟一个年轻作家埋头读文学经典,本质上都是“学习”。虽然作家可能不乐意,但法官至少在这一案上区分了“用内容学习”与“盗版获取内容”两个环节。

一张罚单,两种解读

律师Gellis认为,这个裁决其实对AI公司更有利。15亿美元听着吓人,但相对于Anthropic的体量和整个行业的资源,这笔钱更像是“买路钱”。它把争论的焦点从“能不能用版权书训练”移到了“从哪里拿书训练”。后者可以通过购买正版数据集、获取授权、甚至建设合法的内容库来解决。

对作者来说,这个裁决并没有关闭大门。它承认了“训练侵权”的路径,也给了作者们一个谈判筹码:如果AI公司不解决版权问题,就可能面临巨额的追偿。但与此同时,它也没有完全否定AI学习的正当性。

这件事意味着什么

  • 对作者群体:裁决提供了一个先例,证明“以训练为目的的使用”并非天然违法,但必须有合法的数据来源。如果发现自己作品出现在盗版训练集里,起诉的路是通的。
  • 对AI公司:继续用盗版书训练风险变大,但通过正规授权或购买数据可以规避最重的罚单。成本会上升,但不会动摇商业模式。
  • 对法律界:这只是一系列类似诉讼的开始,后续判例可能会进一步细化“合理使用”的边界,尤其是在美国之外。

怎么看这件事

这不只是一场关于书的争论,而是整个生成式AI时代的核心问题之一:机器“学习”人类作品,到底算不算侵权?目前来看,答案取决于“怎么学”。如果你关心创作者的权益,接下来的关键不是等待一个“有一方全赢”的判决,而是关注数据来源合规化的进程。那些花钱购买正版训练数据、主动建立授权机制的AI公司,可能才是这场博弈里笑到最后的人。

AI训练版权法生成式AIAnthropic著作权影子图书馆法律与技术AI模型训练版权争议大语言模型

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

相似工具

GeoInfer

GeoInfer

GeoInfer 只凭画面本身推断照片拍摄地:借助建筑、地形、植被等视觉线索完成识别,无需 EXIF、GPS 或反查图片。

SharpLines

SharpLines

SharpLines 是 AI 体育预测平台,覆盖 NBA、NFL、MLB、NHL、NCAA 与足球,多模型对赛事进行预测并对各大博彩线做实时对比分析。

Osmosis

Osmosis 是 HMD Secure Sales Hackathon 2026 展示的 CRM 原型,主张让线索、案例和预测从聊天里自然抽取,而不是靠人工填表。

GoodMoat

GoodMoat

GoodMoat 是一款 AI 驱动的股票估值工具,它区别于传统“黑箱”模型,将每个估值数字直接追溯到原始 SEC 文件,并注明来源和刷新时间。它支持任何股票的完整 DCF、反向 DCF(判断市场已定价的增长)以及三种交叉验证的公允价值模型。其 X-Ray 功能通过 AI 深度分析40多项财务指标,将复杂数据转化为对企业护城河或炒作本质的通俗解读。所有 AI 输出均对照原始文件核查,避免幻觉数字,确保结果可靠。

Q-bit AI pro 2.0

qbitaipro.com 的公开落地页仅展示一个终端登录界面和一组演示账号,除去 BTC Futures Engine 的自我描述外,落地页上没有可见的功能清单、团队介绍、监管披露或定价,因此本条目仅陈述可核实内容,不描述官网未披露的能力。

Pommy AI

Pommy AI 是一个面向创始人和营销人员的自动化系统,自动生成、安排并优化社交媒体帖子(reels/shorts)和视频广告活动。它学习品牌声音,设计创意,定位受众并处理跨平台分发,帮助用户以自动驾驶方式扩大增长。

开源项目

Operit:开源安卓 AI 代理,连接模型与工具执行真实任务

Operit 是一个开源的安卓 AI 代理,主要使用 Kotlin 开发。它能够将云端或本地模型与系统工具、终端和浏览器连接起来,从而执行真实的用户任务。该项目在采集时拥有 5669 个 GitHub 星标,采用 Other 许可证。

OctoBot:免费开源的 Python 加密货币交易机器人

OctoBot 是一个免费开源的 Python 加密货币交易机器人,可在 15 个以上交易所自动化交易策略。它提供回测、纸面交易和 Web 界面,帮助用户轻松管理交易。项目采用 GPL-3.0 许可证,目前(采集时)在 GitHub 拥有 6146 个星标。

Casdoor:开源 UI 优先的身份与访问管理平台

Casdoor 是一个开源的、以 UI 为先的身份与访问管理平台,定位为专门的认证服务器。它通过单一管理界面管理用户、组织、应用和身份提供商,并支持 OAuth 2.0、OIDC、SAML 2.0、CAS 和 LDAP 等协议。同时提供 WebAuthn、passkey、TOTP 双重认证、生物识别登录、SCIM 2.0 配置、基于角色的访问控制和多租户组织模型。技术栈采用 React 前端和 Go 与 Beego 后端,可持久化到 MySQL、PostgreSQL 等数据库。项目以 Apache-2.0 许可证开源。

OpenAlice:本地 AI 交易工作空间,采用 Git 式审查工作流

OpenAlice 是一个本地交易工作空间,允许 AI 编码代理通过 Git 风格、审查门控的工作流执行研究、投资组合管理和经纪订单。项目主要使用 TypeScript 开发,采用 AGPL-3.0 许可证,在采集时获得5201个 GitHub 星标。

comp:开源的 AI 原生合规平台

comp 是一个开源的 AI 原生合规平台,可自动化 SOC 2、ISO 27001 等认证流程。作为 Vanta 和 Drata 的自托管替代方案,它降低成本并保护数据安全。基于 TypeScript 构建,提供自动化证据收集、智能策略检查和风险分析。适合重视数据主权和定制化的中型团队。

Awesome-LLM4Cybersecurity:汇总大语言模型与网络安全交叉资源

Awesome-LLM4Cybersecurity 是一个精选的 GitHub 仓库,汇编了大型语言模型与网络安全交叉领域的最新论文、工具、数据集和框架。该仓库由专家社区维护,据项目描述,已获得超过 1600 个星标,是安全研究员和 AI 开发者快速了解或追踪前沿进展的重要资源。项目主要使用 JavaScript 编写,采用 MIT 许可证。