开源数据别乱用!5条线帮你避坑,有人已赔10万
本文作者何自刚,执业20年知识产权律师,以“一人公司(OPC)+AI数字员工”运营爱普纳杰专利所、觅理律所、纳杰公司三个主体。今天拆解全国首例《数据知识产权登记证》司法效力案:数据集为什么能有三重身份、登记证怎么当“初步证据”护身符、开源为什么不等于放弃权利——最后附五条输入合规自检线,逐条给自己打勾。
同一个中文语音数据集,一审法院判它是商业秘密,二审却说不是——但被告该赔的钱一分没少,10万元照付,外加2300元合理开支。
这就是全国首例《数据知识产权登记证》司法效力案:数据堂(北京)诉隐某(上海)。数据堂2021年9月发布“1505小时中文普通话语音数据”开源计划,2023年拿到北京市首批数据知识产权登记证。被告把其中200小时的子集,放到自家官网当数据产品对外披露、诱导注册下载,被判构成不正当竞争。
这个案子把三件事说透了,每件都直接关系到你的AI项目。
一个数据集,可以有三重身份
法院确立了“分类保护、阶梯适用”的三阶梯:
- 内容选择、编排有独创性的,是汇编作品;
- 不为相关领域人员容易获取的,是商业秘密;
- 公开了、又缺独创性、但你花了真金白银投入整理的,是反不正当竞争法第2条保护的竞争性权益。
数据堂的语音库就是第三种——虽然公开了不能算商业秘密,但人家实打实的投入,别人不能白嫖。
登记证是一张“初步证据”护身符
没有相反证据时,登记证=你对数据享有财产性利益+收集行为来源合法的初步证明。
注意“初步”两个字——它能被反证推翻,但关键在:它能帮你把举证责任先顶过去。对方想否认,得自己掏证据来翻。在诉讼里,这就是一个巨大的先手。
开源 ≠ 放弃权利
数据堂用了CC开源协议,被告以为“开源=随便商用”。法院说得明白:是否遵循开源协议(尤其非商业用途条款),是衡量数据服务领域商业道德的重要考量。未经许可、不劳而获地商用,就是不正当竞争。
“输入端登记确权、输出端留痕保密,AI企业的数据护城河,是拿动作堆出来的,不是拿口号喊出来的。” —— 何自刚 | 知识产权律师 | 爱普纳杰·觅理·纳杰(执业20年,以OPC+AI数字员工运营三主体)
五条输入合规自检线,逐条给自己打勾
① 来源合法 —— 训练数据的授权链条完整吗?公共数据走了授权运营吗?从第三方买的数据做尽调了吗?留痕了吗?
② 在先权利 —— 数据里有没有别人的著作权、商业秘密、个人信息?《生成式AI服务管理暂行办法》第7条是强制项,不得侵害他人合法权益。
③ 开源协议 —— 你引用的开源数据集,逐条读过CC协议了吗?商用条款是红线,很多“免费”数据集,其实只是“免费非商用”。
④ 登记确权 —— 自建的数据集,去试点省市申请登记证了吗?截至2025年底,全国已发出超4.8万张证、融资增信近150亿元。数据堂凭一张证,2024年数据交易卖了约9558万元,比前一年涨了76%。
⑤ 防输出泄密 —— 这条最容易被忽视。市场监管总局2026年8月20日刚公布:杭州一位算法专家离职后,把原单位的AI模型专属提示词模板、审查规则、标注规范外发,被罚35万元。官方定性很硬:自然语言类的集成方案、非标运营规则,也能独立构成商业秘密。
三层都得防:输入 → 模型 → 人
抖音诉亿睿科“B612咔叽”案,全国首例AI模型结构和参数受反法保护案——对方照搬漫画特效模型的结构与参数,单案判赔160万元,安卓加iOS两案合计约320万元。
从输入数据(登记证)、到中间模型(商业秘密/竞争性权益)、再到离职员工(保密管理),漏一层就是真金白银的代价。
三条建议,今天就能做
- 马上把在用的开源数据集清单拉出来,逐个核对CC协议的商用条款;
- 立即查一查自建数据集所在省市开没开数据知识产权登记试点,能登记就登记;
- 把提示词模板、模型参数、审查规则纳入保密清单,签好保密协议、做好离职管理。
数据合规这件事,早做是护城河,晚做是学费。别等收到起诉状,才想起去看开源协议。
在数据合规上踩过坑的,欢迎在评论区聊聊。关注公众号「纳杰觅理」,下一篇讲:AI模型被抄了,160万判赔是怎么算出来的——模型资产的双轨保护打法。
何自刚 | 知识产权律师 | 爱普纳杰 · 觅理 · 纳杰
座机:010-65150974 | 手机:15321374076 / 13911268604
本文仅代表作者个人观点,不构成法律意见。如需具体案件分析,欢迎联系我们。