开源大模型的法律风险:从使用许可到衍生作品合规
作者:王冠律师 | 企业常法与人工智能和数字经济
发布日期:2026年6月8日
一、开源AI大模型的生态与法律挑战
2023年以来,以Llama 2/3、Mistral、Falcon为代表的开源大语言模型(LLM)迅速崛起,改变了人工智能产业的格局。与传统的闭源模型(如GPT-4、Claude)不同,开源模型允许开发者下载、修改、微调甚至再分发模型权重,极大地降低了AI应用的门槛。然而,开源大模型的法律问题远比传统开源软件复杂,企业在使用开源AI时面临着前所未有的合规挑战。
从法律性质上看,大语言模型并非传统意义上的"软件",而是一个由训练数据、模型架构(代码)、模型权重(参数矩阵)和分词器组成的复合体。其中,模型权重通常是经过海量数据训练后产生的"暗知识"的载体,其法律属性在著作权法框架下尚无定论。这种模糊性使得传统开源许可证的适用面临根本性的困难。
根据Stanford CRFM(基础模型研究中心)2024年的统计,全球已有超过60万个开源模型发布在Hugging Face等平台,但其中近40%的模型未明确标注许可证条款。这种"事实上的开源"与"法律上的开源"之间的落差,构成了企业使用开源AI的第一重法律风险。
二、主流开源模型许可证的深度比较
当前主流开源大模型的许可证呈现出高度碎片化的特征,远未形成类似GPL、MIT在软件领域的标准化格局。以下对最具代表性的几种许可证进行法律分析。
(一)Llama许可证(Meta)
Meta在2023年7月发布Llama 2时推出了专为其设计的"Llama 2 Community License",2024年4月Llama 3发布后更新为"Llama 3 Community License"。该许可证并非OSI(开放源代码促进会)认可的开源许可证,而是Meta单方面制定的"准开源"许可协议。
核心条款包括:
- 商业使用限制:对于月活用户超过7亿的"大型平台"需要特别授权——这一条款显然针对Google、Amazon等Meta的竞争对手。
- 衍生作品义务:修改模型后发布,必须保留原始许可证标注。
- 名称使用限制:不得使用Meta的名义进行背书或推广。
- 免责声明:模型"按现状"提供,Meta不承担任何责任。
值得注意的是,Llama许可证中含有"acceptance"条款——使用模型即视为同意许可条款。这种"浏览包装(browse-wrap)"式的同意方式在合同法上的效力存在争议,尤其在企业内部使用场景下,员工单方面"使用"模型是否可视为企业接受了许可条款,尚无司法先例澄清。
(二)Mistral许可(Mistral AI)
法国AI公司Mistral采取了更为灵活的双重授权策略。对于Mistral 7B和Mixtral 8x7B,其采用Apache 2.0许可证;而对于Mistral Large等更强大的模型,则采用"Mistral Research License"或商业许可。Apache 2.0许可证是OSI认可的开源许可证,允许自由使用、修改和分发(包括商业用途),但要求保留版权声明和免责声明。从合规角度看,Apache 2.0是当前开源模型领域最"安全"的许可证之一。
(三)Apache 2.0许可证
Apache 2.0是AI开源社区使用最广泛的许可证之一,Falcon、Gemma(早期版本)、StarCoder等众多模型均采用此许可。Apache 2.0的核心特点是:
- 商业友好:允许自由使用、修改、分发、甚至再许可。
- 专利授权:第3条明确包含对必要专利的授权,这对企业用户尤为关键。
- 保留条款:要求在衍生作品中保留原始版权声明。
- 无Copyleft:Apache 2.0不属于"强传染性"许可证,衍生作品可以选择其他许可证发布。
(四)其他值得关注的许可证
Hugging Face开源模型库中常见的许可证还包括:
- MIT许可证:最宽松的许可证,仅要求保留版权声明。Stable Diffusion等模型采用此许可。
- RAIL(Responsible AI License):包含"行为使用限制"的创新型许可证,禁止将模型用于生物识别监控、生成虚假信息等特定用途。
- CC BY-NC 4.0:Creative Commons的非商业许可,仅允许非商业用途,企业应格外注意。
- AGPL-3.0:强Copyleft许可证,要求通过网络提供服务的用户也需要开源修改代码,对AI SaaS服务影响巨大。
| 许可证 | OSI认证 | 商业使用 | 衍生作品 | 专利授权 | 代表模型 |
|---|---|---|---|---|---|
| Llama 3许可 | 否 | 限制性(大型平台受限) | 可 | 未明示 | Llama 3 |
| Apache 2.0 | 是 | 自由 | 可,需保留声明 | 明确授权 | Falcon、Gemma |
| MIT | 是 | 自由 | 自由 | 无 | Stable Diffusion |
| AGPL-3.0 | 是 | 可,但须全量开源 | 强Copyleft | 明确授权 | 部分微调模型 |
| RAIL | 否 | 有使用限制 | 受限 | 视版本而定 | BigScience BLOOM |
三、开源AI与传统开源软件的法律差异
将传统开源软件的法律框架直接套用于开源大模型,可能产生严重的法律误判。二者之间存在至少四个维度的根本性差异。
第一,客体的不确定性。传统开源软件保护的是源代码——一种人类的创作表达。而大模型的"核心资产"是模型权重——一个经过优化后产生的高维参数矩阵。美国版权局在2023年3月发布的《AI与著作权》政策声明中明确指出,由AI自动生成的内容不具有著作权。虽然该声明针对的是AI输出而非模型本身,但类似的逻辑可能影响模型权重是否构成著作权法意义上的"作品"。
第二,许可证的适用方式不同。在软件领域,许可证附着于代码本身。而大模型的"分发"可以是预训练权重文件(可能是几GB到几百GB的二进制文件),也可以是API调用接口。API调用不应被视为"分发"(distribution),因此传统许可证中的"Copyleft"条款在API场景下可能完全不适用。这正是AGPL许可证之所以要特别定义"交互"(interaction)条款的原因。
第三,衍生作品的定义模糊。在软件领域,修改源代码后发布即构成衍生作品。但在AI领域,"微调(fine-tuning)"一个预训练模型——即在已有权重基础上使用特定领域数据进行继续训练——产生的模型是否构成"衍生作品",目前的司法实践尚无定论。如果微调仅改变了权重矩阵中的极小部分参数,这究竟是"修改"还是"重新训练"?法律边界亟需厘清。
第四,训练数据的版权污染。开源软件本身不包含版权受保护的内容。但开源大模型在训练过程中可能学习了大量受版权保护的材料(如书籍、论文、新闻文章),而当模型"记忆"并复现这些材料时,输出可能构成版权侵权。这种"训练数据->模型->输出"的侵权链条在传统软件领域不存在。
四、衍生作品的合规边界
企业使用开源大模型时,最常见的场景是对预训练模型进行微调(fine-tuning)以适应特定业务需求。这一行为是否产生"衍生作品"(derivative work),以及衍生作品应遵守何种合规义务,是当前法律实务中最棘手的问题之一。
从著作权法原理分析,衍生作品是指基于一个或多个已有作品进行改编、翻译、注释、整理而形成的作品。如果微调过程涉及:
- 修改模型架构代码——这部分代码通常受版权保护,修改后可能构成衍生作品;
- 在已有权重基础上继续训练——权重的法律属性不明确,但许可证通常将权重也纳入许可范围;
- 使用LoRA(Low-Rank Adaptation)等参数高效微调技术——仅添加少量适配器参数,基座模型权重不变。
针对场景三,一种有力的学术观点认为,LoRA微调不构成"修改"基座模型,而只是在模型外部附加了一个"适配层",因此不触发开源许可证中关于衍生作品的义务。但这一观点尚未获得司法机关的确认。实务上,采取更为审慎的立场:只要微调涉及对模型权重的任何改变,应视为"使用"而非"修改",但企业应严格审查所使用的基础模型许可证对于微调行为的具体规定。
实务提示:Apache 2.0许可证明确允许"修改"和"衍生作品",要求保留原始版权声明。Llama许可证同样允许修改和衍生,但要求衍生作品继续适用Llama许可(如果公开发布)。MIT许可证无任何衍生作品限制。建议企业在选择基座模型时,优先选择Apache 2.0或MIT许可的模型以降低合规风险。
五、开源模型微调后的版权归属
微调后的模型版权归属问题,涉及原始模型权利人与微调者之间的权利边界。这一问题可以从三个层面加以分析。
(一)原始模型权利人的权利范围
如果原始模型采用Apache 2.0或MIT等宽松许可证发布,权利人已授予被许可人广泛的使用、修改和分发权利。在此情况下,微调后的模型版权归属于微调者——但前提是微调产生了足够的"创造性"要素,使其构成著作权法意义上的独立作品。然而,如果微调仅涉及少量领域数据(如几千条样本)的简短训练,法律上可能难以认定其具有独立的原创性。
(二)Copyleft许可证下的特殊情形
如果原始模型采用AGPL-3.0等强Copyleft许可证,微调后的模型可能被视为"衍生作品",继而必须遵循AGPL的"传染"义务——即公开发布时必须提供完整源代码。这对于将微调模型用于商业SaaS服务的企业而言,可能产生重大的开源合规风险。需要特别注意的是,AI模型领域的Copyleft条款的实际可执行性尚待司法检验。
(三)企业内部的权属约定
除开源许可证外,企业还应通过合同约定明确微调模型的权属。如果微调是委托第三方(如AI开发公司、高校实验室)完成的,合同中应明确约定:
- 微调后模型的知识产权归属;
- 微调所使用的训练数据的权属和责任;
- 第三方所使用的基础模型的许可证合规保证;
- 模型交付后的使用限制。
六、企业使用开源AI的合规框架
基于上述法律风险分析,建议企业建立以下开源AI合规框架:
(一)许可证审查机制
在使用任何开源模型之前,建立标准化的许可证审查流程:
- 明确识别模型使用的许可证类型,并确认其是否为OSI认证的开源许可证;
- 审查许可证中是否包含使用限制(如Llama的月活限制、RAIL的行为限制);
- 评估许可证与企业的商业模式的兼容性(尤其是API服务模式);
- 记录并归档许可证审查结果。
(二)合规矩阵建设
根据不同使用场景建立差异化的合规策略:
| 使用场景 | 风险等级 | 核心合规要求 |
|---|---|---|
| API调用(不下载模型) | 低 | 遵守API服务条款 |
| 本地部署+未修改 | 中 | 确认许可证允许部署 |
| 微调+Lora适配器 | 中高 | 审查许可证对微调的规定 |
| 全量微调+再分发 | 高 | 法律顾问全程介入 |
(三)内部治理制度
将开源AI合规纳入企业已有的开源治理体系:
- 建立开源AI模型清单,定期更新;
- 制定《开源AI使用指引》,明确员工在使用开源模型时的合规要求;
- 设立AI合规审查委员会,对重大AI项目进行事先审查;
- 与法务、IT、数据合规团队建立联动机制。
(四)供应链合规管理
当企业采购的第三方AI产品或服务中嵌入了开源模型时,应要求供应商:
- 明确披露所使用的开源模型及其许可证;
- 就模型训练数据的合规性作出陈述与保证;
- 对模型输出可能侵犯第三方权利提供赔偿保障。
七、结语与展望
开源大模型的兴起是人工智能民主化的重要力量,但其法律框架仍然处于形成过程中。随着欧盟《人工智能法案》(EU AI Act)的逐步实施,以及各国对AI治理的立法加强,开源AI的法律环境将持续变化。企业应当保持对开源AI法律动态的持续关注,在享受开源红利的同时,将法律风险控制在可接受的范围内。
开源AI的许可证仍在演进——Meta的Llama许可、Mistral的双重授权模式、RAIL行为限制许可等新型许可格式的出现,反映了行业对AI特有法律问题的回应。可以预见,未来可能会形成专门针对AI模型的标准化开源许可证体系。在此之前,谨慎合规是企业使用开源AI的不二法门。
免责声明:本文仅为一般性法律信息分享,不构成对任何具体事项的法律意见。法律环境因司法管辖区和时间而有所差异,读者在依据本文内容采取行动前,应就具体情况咨询合格的法律专业人士。作者不承担因依据本文内容行事而产生的任何法律责任。