大约每个写过书的人都可能已经成了AI训练数据的“贡献者”,只是本人不知道。ChatGPT、Gemini、Claude这些聊天机器人的背后,模型从数以亿计的书籍、文章、论文里学会了语言。对于作者来说,这像是一场无遮无掩的“借用”——自己的作品被拿去喂给了将要取代自己的工具。这种感觉当然很糟糕。
但糟糕归糟糕,法律上这事远没有一句“这就是侵权”那么简单。专注于知识产权与互联网法的律师Cathy Gellis对媒体直言:这个领域里“有太多的事情同时发生”,有大量情绪化的争论,但也有技术上的残酷现实。
“合法但罚了15亿”的裁决
去年的一起案件成了标志性事件。法官William Alsup要求Anthropic向一批作家支付高达15亿美元的版权赔偿。看到这个数字,很多人下意识地认为作者赢了。然而真正读判决会发现,法官并非认定AI训练行为非法。
Alsup给出的结论是:Anthropic的模型训练本身不违法——违法的是模型公司从非法的在线影子图书馆里把书“偷”出来当训练数据。换句话说,同样一本书,通过正规渠道购买后用来训练可能没问题;从盗版网站批量下载,就是另一回事。
“像任何渴望成为作家的读者一样,Anthropic的大语言模型训练并不是为了抢先复制或取代作品,而是为了转过一个艰难的弯,去创造不同的东西。”——法官William Alsup
这个比喻很有文学味:模型读了几万亿词,跟一个年轻作家埋头读文学经典,本质上都是“学习”。虽然作家可能不乐意,但法官至少在这一案上区分了“用内容学习”与“盗版获取内容”两个环节。
一张罚单,两种解读
律师Gellis认为,这个裁决其实对AI公司更有利。15亿美元听着吓人,但相对于Anthropic的体量和整个行业的资源,这笔钱更像是“买路钱”。它把争论的焦点从“能不能用版权书训练”移到了“从哪里拿书训练”。后者可以通过购买正版数据集、获取授权、甚至建设合法的内容库来解决。
对作者来说,这个裁决并没有关闭大门。它承认了“训练侵权”的路径,也给了作者们一个谈判筹码:如果AI公司不解决版权问题,就可能面临巨额的追偿。但与此同时,它也没有完全否定AI学习的正当性。
这件事意味着什么
- 对作者群体:裁决提供了一个先例,证明“以训练为目的的使用”并非天然违法,但必须有合法的数据来源。如果发现自己作品出现在盗版训练集里,起诉的路是通的。
- 对AI公司:继续用盗版书训练风险变大,但通过正规授权或购买数据可以规避最重的罚单。成本会上升,但不会动摇商业模式。
- 对法律界:这只是一系列类似诉讼的开始,后续判例可能会进一步细化“合理使用”的边界,尤其是在美国之外。
怎么看这件事
这不只是一场关于书的争论,而是整个生成式AI时代的核心问题之一:机器“学习”人类作品,到底算不算侵权?目前来看,答案取决于“怎么学”。如果你关心创作者的权益,接下来的关键不是等待一个“有一方全赢”的判决,而是关注数据来源合规化的进程。那些花钱购买正版训练数据、主动建立授权机制的AI公司,可能才是这场博弈里笑到最后的人。











评论
暂无评论
成为第一个评论的人