← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
开放权重与开源AI模型:有何区别?
大多数被称为“开源”的模型实际上是开放权重——权重文件可供下载,但训练数据和完整的许可自由并未开放。本文阐述两者的区别、OSI开源AI定义、主流模型在谱系中的位置,以及这一标签对商业使用的实际意义。
核心区别
“开放权重”是指经过训练的模型参数可供下载,但训练数据、训练代码或完整的许可自由可能被保留。官方定义中的“开源AI”还额外要求提供数据信息、训练及推理代码,且均须以开放条款发布。若不披露训练数据,该次发布便属于开放权重,而非开源。
这一点之所以重要,是因为这两个术语经常被混为一谈。一个能够下载并运行的模型,并不自动等同于软件世界所说的“开源”——而差异恰恰体现在最关键之处:商业权利、可复现性,以及你实际上被允许做什么。
OSI开源AI定义
2024年10月,Open Source Initiative发布了首个稳定版《开源AI定义》。该定义赋予四项自由——无需获得许可即可为任何目的使用系统、研究其工作原理、为任何目的修改它,以及在有无修改的情况下分享它——并要求三项组件:数据信息(足以构建实质等效系统的详细说明)、完整的训练与推理代码,以及模型参数。
该定义最具争议的妥协在于:它并不要求发布原始训练数据集本身,而只需提供关于该数据集的足够详细的信息。批评者认为这是一种弱化;支持者则指出,法律和隐私方面的限制往往使发布原始数据成为不可能。无论如何,这都是衡量“开源”主张时应当依据的基准。
主流模型的实际归属
大多数知名的“开放”模型属于开放权重,而非开源:
- Llama以社区许可证形式发布,属于开放权重——Meta未公开训练数据,且许可证附加了可接受使用政策、月活用户7亿的条款,以及禁止使用其输出训练竞争模型的限制。它不符合“无需许可即可为任何目的使用”的自由,因此属于可查看源码,而非开源。(参见我们的[Llama指南](/articles/run-llama-locally-hardware-guide)。)
- Qwen和Mistral的许多模型采用Apache-2.0发布——这是权重层面真正的开源许可证,允许宽松的商业使用;但由于缺乏完整的数据和代码,它们仍属于“宽松许可的开放权重”,而非OSAID意义上的开源。(参见我们的[Qwen3指南](/articles/run-qwen3-locally-guide)。)
- OLMo(来自Ai2)是真正开源的参考标准:权重加上完整的训练语料库、训练代码、日志和检查点。
- DeepSeek属于开放权重——权重已发布,但训练数据未披露。
许可证谱系
将其理解为从最开放到最封闭的谱系会更有帮助:
- 完全开放 / 符合OSAID:权重加数据加代码(OLMo)。
- 权重采用宽松OSI许可证:Apache-2.0(Qwen、Mistral)——权重不受商业限制,但未完整披露数据/代码。
- 限制性“社区”许可 / 可查看源码:Llama——可商业使用,但有用户上限、可接受使用规则和竞争对手限制。
- 非商业 / 仅限研究:部分模型变体限制为非商业用途。
- 仅限API / 封闭:权重从未发布。
了解模型所处的位置,就能知道你在法律上可以对其做些什么——相比它是否赢得“开源”标签,这才是更实际的问题。
为何重要,以及“开源洗白”
这个标签有着实际的影响。许可条款——月活用户上限、使用领域禁令、禁止蒸馏条款——直接决定商业合法性。严格意义上的开源还能让模型得以复现和审计,这对信任和研究至关重要。监管的介入更是抬高了风险:欧盟AI法案对开源系统给予特定豁免,因此将开放权重模型称为“开源”不仅是用词不当——还可能带来实质性后果。
这正是“开源洗白”批评的核心:将一个充其量只是开放权重的模型当作开源来营销。针对生成式AI系统的研究发现,许多“开源”标签在现实中只是开放权重,而更宏观的趋势也印证了这一点——公开训练数据的模型下载量占比急剧下降,意味着整个生态系统正在走向开放权重,而非开源。
osFoundry的处理方式
无论模型在谱系中处于何种位置,osFoundry均可运行开放权重模型——宽松的Apache-2.0(Qwen、Mistral)、限制性社区许可(Llama)和完全开放(OLMo)都以相同的方式通过BYOK或自托管运行。由于开源与开放权重之争从根本上关乎许可证,osFoundry会展示每个模型的实际许可条款——用户上限条款、禁止蒸馏规则和非商业限制——以便团队在商业部署前确认合法性。通过BYOK和自托管,你可以将权重、数据和推理保持在自己的掌控之下,而非置于供应商API之后,这正是“开放”的实际收益——无论某个模型是否能够通过严格的开源标准。
Frequently asked questions
- 开放权重AI模型与开源AI模型有什么区别?
- 开放权重是指模型经过训练的参数可供下载,但训练数据、代码或许可自由可能被保留。OSI定义的开源还额外要求在开放条款下提供数据信息和训练/推理代码。如果未披露训练数据,则该模型属于开放权重,而非开源。
- Llama是开源的吗?
- 不是——Llama以社区许可证形式发布,属于开放权重。Meta未发布训练数据,许可证还附加了可接受使用政策、月活7亿用户的门槛,以及禁止使用其输出训练竞争模型的限制。OSI等机构将其归类为可查看源码或开放权重,而非开源。
- 什么是OSI开源AI定义?
- 该定义于2024年10月发布,是首个稳定的开源AI定义。它赋予四项自由——使用、研究、修改和分享——并要求三项组件:数据信息、完整的训练与推理代码,以及模型参数。值得注意的是,它要求提供关于训练数据的详细信息,而非原始数据集本身。
- 开源AI是否需要发布训练数据?
- 不需要原始数据集——OSI定义要求提供足够详细的数据信息,使具备相应能力的人能够构建实质等效的系统,且仅在法律允许时才需提供实际数据。这一妥协是该定义中争议最大的部分,因为真正的可复现性可以说需要数据本身。
- 我可以免费将开放权重模型用于商业目的吗?
- 通常可以,但完全取决于许可证。Apache-2.0模型(许多Qwen和Mistral版本)允许不受限制的商业使用。Llama的社区许可证允许商业使用,但有用户数量上限和其他限制。部分变体仅限非商业用途。在商业部署前,请务必检查具体模型的许可证。
- 哪些AI模型是真正的开源?
- 那些同时发布权重、训练数据以及完整训练和推理代码的模型——Ai2的OLMo是领先示例,公开了其语料库、代码、日志和检查点。大多数流行的“开放”模型(Llama、Qwen、Mistral、DeepSeek)属于开放权重,至少保留了训练数据。
- Apache-2.0模型等同于开源吗?
- Apache-2.0是真正的开源许可证,因此采用Apache-2.0的权重不受商业限制且具有宽松性。但采用Apache-2.0权重的模型,若未同时发布训练数据信息和代码,仍不满足OSI AI定义下“完全开源”的要求——因此最准确的描述是“宽松许可的开放权重”。
Sources