最近404 Media挖出一条新闻,业内讨论挺多的:
多家AI公司通过中间商大规模收购二手图书,用于训练AI模型。
Anthropic曾投入数百万美元买纸质书,扫描提取内容训练Claude后,把书销毁了。
法院认为,用正版图书训练AI属于「合理使用」;但Anthropic同时持有一个700万册盗版图书的数据库,这部分被判赔15亿美元。
出版商联盟起诉Google,指控其未经授权用数百万本受版权保护的图书训练Gemini。
入行二十余年,我见过不少IP领域的边界争议。这个案子有意思的地方在于——它把AI训练数据的版权红线划得很清楚,但很多人没看懂那条线到底在哪。
关键细节:法院说了两件事,结论完全相反。
第一件事:买实体书扫描用于AI训练 → 合理使用 ✅
Anthropic从Better World Books合法购买二手书,拆开扫描,喂给Claude,然后销毁实体书。法院认为这属于合理使用(fair use)。
道理不复杂:
这个逻辑延续了Google Books案(Authors Guild v. Google, 2015)的判例。当年Google扫描了2000万本书,只让用户搜索片段,法院也认定是合理使用。
第二件事:长期持有盗版数字数据库 → 侵权 ❌
同一家公司,另一边握着一个700万册盗版图书的数据库——这个就踩红线了。15亿美元赔的就是这个部分。
边界其实很清晰:你买了实体书,扫描用于内部训练,没问题。但保存大量未经授权的数字副本,甚至可能用于二次传播,那就越界了。
这个区分,恰恰是国内很多AI公司容易忽略的。
同样的逻辑搬到国内,有三个问题比美国更棘手:
问题1:没有明确的「合理使用」判例
美国有fair use制度,有Google Books案、Anthropic案做参照。中国《著作权法》第24条虽然列举了合理使用情形,但AI训练数据是否适用,目前没有明确的司法意见。换句话说,你做了跟Anthropic一样的事,在美国可能没事,在国内不一定。
问题2:爬虫数据的合规风险
很多AI训练数据来自网络爬虫。国内已经有不少爬虫被判侵权的案例——大众点评诉百度地图、新浪微博诉脉脉等。虽然这些案子不直接涉及AI训练,但逻辑是相通的:未经许可大规模获取他人数据,合规风险不小。
问题3:版权登记的价值
国内诉讼中,完成版权登记的作品在举证上优势明显。AI公司建训练数据集时,建议建立清晰的版权审核流程——哪些有版权、哪些无版权、哪些拿到了授权,分清楚再往里放。
这个案子不只是AI公司该关心。任何有IP资产的企业,都应该关注训练数据版权争议的走向。
如果你是AI公司:
如果你是内容/出版企业:
另外,不同法域的态度差异很大——欧洲有《人工智能法案》,美国靠fair use判例,日本修法允许AI训练使用版权作品。如果你的业务涉及出海,需要按不同国家的规则分别处理。
AI和版权交叉的领域,很多问题确实还没有定论。这篇文章引用的案件信息来源于公开报道,具体案情以法院判决书为准,不构成法律意见。
010-65150974 / 13911268604
何自刚 | 知识产权律师 | 爱普纳杰·觅理·纳杰
本文仅代表作者个人观点,不构成法律意见。