最近404 Media挖出一条新闻,业内讨论挺多的:


多家AI公司通过中间商大规模收购二手图书,用于训练AI模型。
Anthropic曾投入数百万美元买纸质书,扫描提取内容训练Claude后,把书销毁了。
法院认为,用正版图书训练AI属于「合理使用」;但Anthropic同时持有一个700万册盗版图书的数据库,这部分被判赔15亿美元。
出版商联盟起诉Google,指控其未经授权用数百万本受版权保护的图书训练Gemini。

入行二十余年,我见过不少IP领域的边界争议。这个案子有意思的地方在于——它把AI训练数据的版权红线划得很清楚,但很多人没看懂那条线到底在哪。





关键细节:法院说了两件事,结论完全相反。


第一件事:买实体书扫描用于AI训练 → 合理使用 ✅


Anthropic从Better World Books合法购买二手书,拆开扫描,喂给Claude,然后销毁实体书。法院认为这属于合理使用(fair use)。


道理不复杂:

  • 买的是**合法出版物**,不是盗版
  • 扫描是**转换性使用**——书本来是给人读的,现在变成AI的训练数据
  • 没有替代原书的市场——买书的人不打算看书,目的是提取数据训练模型

  • 这个逻辑延续了Google Books案(Authors Guild v. Google, 2015)的判例。当年Google扫描了2000万本书,只让用户搜索片段,法院也认定是合理使用。


    第二件事:长期持有盗版数字数据库 → 侵权 ❌


    同一家公司,另一边握着一个700万册盗版图书的数据库——这个就踩红线了。15亿美元赔的就是这个部分。


    边界其实很清晰:你买了实体书,扫描用于内部训练,没问题。但保存大量未经授权的数字副本,甚至可能用于二次传播,那就越界了。


    这个区分,恰恰是国内很多AI公司容易忽略的。





    同样的逻辑搬到国内,有三个问题比美国更棘手:


    问题1:没有明确的「合理使用」判例


    美国有fair use制度,有Google Books案、Anthropic案做参照。中国《著作权法》第24条虽然列举了合理使用情形,但AI训练数据是否适用,目前没有明确的司法意见。换句话说,你做了跟Anthropic一样的事,在美国可能没事,在国内不一定。


    问题2:爬虫数据的合规风险


    很多AI训练数据来自网络爬虫。国内已经有不少爬虫被判侵权的案例——大众点评诉百度地图、新浪微博诉脉脉等。虽然这些案子不直接涉及AI训练,但逻辑是相通的:未经许可大规模获取他人数据,合规风险不小。


    问题3:版权登记的价值


    国内诉讼中,完成版权登记的作品在举证上优势明显。AI公司建训练数据集时,建议建立清晰的版权审核流程——哪些有版权、哪些无版权、哪些拿到了授权,分清楚再往里放。





    这个案子不只是AI公司该关心。任何有IP资产的企业,都应该关注训练数据版权争议的走向。


    如果你是AI公司:

  • 训练数据来源是否合法?
  • 是否涉及大量有版权作品?
  • 数据使用是否超出授权范围?
  • 有没有保存未经授权的数字副本?

  • 如果你是内容/出版企业:

  • 你的作品有没有被纳入训练数据集?
  • 有没有技术手段去检测?
  • 跟AI公司之间的授权合同够不够完善?

  • 另外,不同法域的态度差异很大——欧洲有《人工智能法案》,美国靠fair use判例,日本修法允许AI训练使用版权作品。如果你的业务涉及出海,需要按不同国家的规则分别处理。




    AI和版权交叉的领域,很多问题确实还没有定论。这篇文章引用的案件信息来源于公开报道,具体案情以法院判决书为准,不构成法律意见。


    010-65150974 / 13911268604

    何自刚 | 知识产权律师 | 爱普纳杰·觅理·纳杰

    本文仅代表作者个人观点,不构成法律意见。