8月的热搜上,一条出版行业的消息引发讨论:有出版社在图书版权页标注"书籍内容禁用于AI训练",并表示取证、维权难度很高,标注的意义更多在于"明确版权态度"。
一纸标注,究竟能拦住大模型吗?对读者、对企业、对AI服务提供者,它分别意味着什么?我们试着从著作权法的角度拆开来看。
首先要厘清:图书版权页上的"禁用于AI训练"标注,属于权利人的单方意思表示。它的效力取决于相对人是否"看见并接受"。
对购买纸质书的个人读者而言,买到书意味着取得了一个有体物(书)的所有权,但并没有取得作品的著作权。读者可以把书送给朋友、可以转卖二手,这是《著作权法》第10条第1款第6项"发行权一次用尽"的体现;但"把整本书数字化后喂给AI模型训练",已经不是对书籍这一有体物的正常使用,而是落入了复制权的射程。
对标注"明知故犯"的一方,权利人可以主张:
但难点也很现实:AI训练语料的规模动辄百万级文本,权利人很难证明"哪一本书、哪一段文字、被哪个模型"复制使用。标注的法律价值,更多是"立场声明+事后追责的铺垫",而不是预先拦路的栅栏。真正能形成约束的,是数据来源的合规链条,而不是封面上的几个字。
要理解这场博弈,需要把AI训练拆成三个环节,分别对应不同的版权问题:
输入端:复制行为。 把作品数字化、写入训练语料库,是典型的复制行为。除非落入合理使用,否则需要获得许可。
训练过程:学习"思想"还是"表达"。 著作权保护的是表达,不保护思想——这是"思想与表达二分法"的基本原则。模型学习的是作品的风格、规律、事实和逻辑结构,这些大多属于"思想"层面,本身并不侵权;真正的风险在于,训练是否发生了对"表达"的复制与重现。
输出端:生成内容的实质性相似。 当模型输出与在先作品构成实质性相似的片段时,才直接踩到侵权红线。这也是目前多起AI版权诉讼的争议焦点。
一个常见的误解是"模型是黑箱,谁也不知道学了什么"。但在法律上,责任不是看模型内核如何运作,而是看数据从哪来、输出像什么。
值得企业关注的是,与AI训练相关的合规义务并不是空白。
《生成式人工智能服务管理暂行办法》(2023年8月15日施行)第7条明确要求:生成式AI服务提供者在开展预训练、优化训练等训练数据处理活动时,应当使用具有合法来源的数据和基础模型;涉及个人信息的,应当取得个人同意或符合法定情形;同时应当采取措施提高训练数据质量,增强数据的真实性、准确性、客观性、多样性。
换句话说,训练数据的"合法性来源"已经不是道德倡议,而是服务提供者的法定义务。所谓"爬来的数据拿来就用"的粗放模式,在合规框架下已经走不通。
在司法层面,围绕AI生成的版权争议正在密集展开:从"AI生成内容能否构成作品"的确认,到训练端大规模使用作品是否构成合理使用,多个标志性案件都在审理或裁判过程中。立法与判例仍在快速演进,但方向是清晰的——用别人的作品训练模型,不能假设默示许可存在。
对正在或准备使用AI工具的企业,有三件事值得现在就做:
1. 审查数据来源,建立"来源台账"。 无论自研模型还是采购第三方服务,都应要求服务商说明训练数据来源的合法性,并在合同中写入数据来源合规承诺与违约救济条款。企业自建部署AI时,对喂给系统的自有资料先做权利梳理——哪些自有、哪些获得授权、哪些来源不明。
2. 对外提供作品时,主动管理授权边界。 出版机构、内容平台、创作型企业,可以在授权协议中明确"是否允许用于模型训练"以及训练用途的范围、期限、对价。与其事后标注,不如事前把条款写清楚——标注只能防君子,合同才能防诉讼。
3. 关注输出端风险,建立内容风控。 生成内容上线前进行侵权比对与人工复核,特别是涉及他人作品元素、品牌、肖像的使用场景。AI时代的内容合规,是输入端与输出端的双重功课。
回到那则标注引发的热搜:一纸"禁AI标注"挡不住技术的浪潮,但它像一块路标,标记着版权人与技术开发者之间尚未划清边界的地带。
对版权人而言,标注是姿态,合同才是武器;对技术企业而言,训练数据的合规不是成本,而是护城河。这条边界最终会由立法、判例与商业实践共同划定,而先行把规则梳理清楚的企业,会在新一轮博弈中占据主动。
AI合规与知识产权保护,正是我们日常处理的事务——无论您是需要为作品登记权利、梳理训练数据的授权链条,还是在AI使用中遇到版权争议,都可以与我们沟通。
纳杰知识产权 | 爱普纳杰专利代理 | 觅理律师事务所
联系电话:010-65150974