← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
오픈 웨이트 vs 오픈 소스 AI 모델: 무엇이 다른가?
"오픈 소스"라고 불리는 모델 대부분은 실제로는 오픈 웨이트입니다 — 가중치는 다운로드할 수 있지만 학습 데이터와 완전한 라이선스 자유는 제공되지 않습니다. 이 글은 그 차이점, OSI 오픈 소스 AI 정의, 인기 모델이 스펙트럼상 어디에 위치하는지, 그리고 상업적 이용에 있어 이 레이블이 왜 중요한지를 설명합니다.
핵심적인 차이
"오픈 웨이트"란 학습된 모델 파라미터를 다운로드할 수 있다는 의미이지만, 학습 데이터, 학습 코드 또는 완전한 라이선스 자유는 공개되지 않을 수 있습니다. 공식 정의에 따른 "오픈 소스 AI"는 여기에 더해, 데이터 정보와 학습 및 추론 코드를 모두 개방적인 조건으로 제공할 것을 요구합니다. 학습 데이터가 공개되지 않으면 해당 릴리스는 오픈 소스가 아니라 오픈 웨이트입니다.
이것이 중요한 이유는 두 용어가 끊임없이 혼용되기 때문입니다. 다운로드해서 실행할 수 있는 모델이라고 해서 소프트웨어 업계가 말하는 "오픈 소스"와 자동으로 같아지는 것은 아닙니다 — 그 차이는 가장 중요한 지점에서 분명하게 드러납니다. 바로 상업적 권리, 재현 가능성, 그리고 실제로 무엇이 허용되는가 하는 점입니다.
OSI 오픈 소스 AI 정의
2024년 10월, Open Source Initiative는 최초의 안정적인 오픈 소스 AI 정의를 발표했습니다. 이 정의는 네 가지 자유를 부여합니다 — 허가 없이 어떤 목적으로든 시스템을 사용하는 자유, 그 작동 방식을 연구하는 자유, 어떤 목적으로든 수정하는 자유, 수정 여부와 무관하게 공유하는 자유 — 그리고 세 가지 구성 요소를 요구합니다. 즉, 데이터 정보(실질적으로 동등한 시스템을 구축하기에 충분한 세부 정보), 완전한 학습 및 추론 코드, 그리고 모델 파라미터입니다.
가장 논란이 많은 타협점은, 원시 학습 데이터셋 자체의 공개까지는 요구하지 않고 그에 관한 충분히 상세한 정보만을 요구한다는 점입니다. 비평가들은 이를 약화라고 부르고, 지지자들은 법적·개인정보 보호 제약 탓에 원시 데이터 공개가 불가능한 경우가 많다고 지적합니다. 어느 쪽이든, 이것이 "오픈 소스" 주장을 가늠하는 기준이 됩니다.
인기 모델들의 실제 위치
잘 알려진 "오픈" 모델 대부분은 오픈 소스가 아니라 오픈 웨이트입니다:
- Llama는 커뮤니티 라이선스 하의 오픈 웨이트입니다 — Meta는 학습 데이터를 공개하지 않으며, 라이선스에는 허용 사용 정책, 월 7억 명 활성 사용자 조항, 그리고 출력을 경쟁 모델 학습에 사용하는 것에 대한 제한이 포함됩니다. "허가 없이 어떤 목적으로든 사용"할 자유를 충족하지 못하므로 소스 공개(source-available)이지 오픈 소스가 아닙니다. ([Llama 가이드](/articles/run-llama-locally-hardware-guide)를 참조하세요.)
- Qwen과 Mistral은 많은 모델을 Apache-2.0으로 출시합니다 — 가중치에 대한 진정한 오픈 소스 라이선스로서 상업적 이용이 자유롭지만, 완전한 데이터와 코드가 없기 때문에 OSAID 기준의 오픈이 아니라 "허용적 라이선스의 오픈 웨이트"에 해당합니다. ([Qwen3 가이드](/articles/run-qwen3-locally-guide)를 참조하세요.)
- OLMo(Ai2 제작)는 진정한 개방성의 기준이 되는 사례입니다: 가중치와 함께 전체 학습 코퍼스, 학습 코드, 로그, 체크포인트까지 제공합니다.
- DeepSeek은 오픈 웨이트입니다 — 가중치는 공개되었지만 학습 데이터는 비공개입니다.
라이선스 스펙트럼
가장 개방적인 것부터 가장 폐쇄적인 것까지 스펙트럼으로 생각하면 이해하기 쉽습니다:
- 완전히 개방 / OSAID 부합: 가중치 + 데이터 + 코드 (OLMo).
- 가중치에 허용적인 OSI 라이선스: Apache-2.0 (Qwen, Mistral) — 상업적으로 제한 없는 가중치, 하지만 완전한 데이터/코드는 미공개.
- 제한적인 "커뮤니티" / 소스 공개: Llama — 상업적 이용은 가능하지만 상한선, 허용 사용 규칙, 경쟁사 관련 제한이 있음.
- 비상업용 / 연구 전용: 일부 모델 변형은 비상업적 이용으로만 제한됨.
- API 전용 / 폐쇄형: 가중치가 전혀 공개되지 않음.
모델이 어디에 위치하는지 알면 법적으로 무엇을 할 수 있는지 알 수 있습니다 — 이는 "오픈 소스" 배지를 얻느냐 마느냐보다 더 실질적인 문제입니다.
왜 중요한가, 그리고 "오픈 워싱"
이 레이블은 실질적인 결과를 낳습니다. 라이선스 조건 — 월간 활성 사용자 상한, 사용 분야 금지, 증류 금지 조항 — 은 상업적 합법성을 직접 좌우합니다. (엄격한 의미의) 오픈 소스는 여기에 더해 모델을 재현하고 감사할 수 있게 해 주며, 이는 신뢰와 연구에 중요합니다. 또한 규제는 위험 부담을 한층 더 높이고 있습니다: EU AI Act는 오픈 소스 시스템에 특정 면제를 부여하므로, 오픈 웨이트 모델을 "오픈 소스"라고 부르는 것은 단순한 부주의를 넘어 중대한 결과를 초래할 수 있습니다.
이것이 "오픈 워싱" 비판의 핵심입니다: 기껏해야 오픈 웨이트에 불과한 모델을 오픈 소스로 마케팅하는 것입니다. 생성형 AI 시스템에 관한 연구들은 많은 "오픈 소스" 레이블이 실제로는 오픈 웨이트임을 밝혀냈으며, 더 넓은 추세 역시 이를 뒷받침합니다 — 학습 데이터를 공개하는 모델 다운로드의 비율이 급락했다는 것은, 생태계가 오픈 소스가 아니라 오픈 웨이트로 향하고 있음을 의미합니다.
osFoundry의 접근 방식
osFoundry는 스펙트럼상 어디에 위치하든 오픈 웨이트 모델을 실행합니다 — 허용적인 Apache-2.0 (Qwen, Mistral), 제한적인 커뮤니티 라이선스 (Llama), 완전히 개방된 (OLMo) 모델 모두 BYOK 또는 셀프 호스팅을 통해 동일한 방식으로 작동합니다. 오픈이냐 오픈 웨이트냐의 문제는 근본적으로 라이선싱에 관한 것이므로, osFoundry는 각 모델의 실제 라이선스 조건 — 사용자 상한 조항, 증류 금지 규칙, 비상업적 제한 — 을 표시하여 팀이 상업적으로 배포하기 전에 합법성을 확인할 수 있게 합니다. BYOK와 셀프 호스트를 통해 가중치, 데이터, 추론을 벤더 API 뒤가 아니라 자체 통제 하에 둘 수 있습니다 — 이것이 바로 특정 모델이 엄격한 오픈 소스 기준을 충족하든 그렇지 않든 누릴 수 있는 "개방성"의 실질적인 이점입니다.
Frequently asked questions
- 오픈 웨이트 AI 모델과 오픈 소스 AI 모델의 차이점은 무엇인가요?
- 오픈 웨이트란 모델의 학습된 파라미터를 다운로드할 수 있다는 의미이지만, 학습 데이터, 코드 또는 라이선스 자유는 공개되지 않을 수 있습니다. 오픈 소스(OSI 정의에 따름)는 여기에 더해 개방적인 조건으로 데이터 정보와 학습/추론 코드를 제공할 것을 요구합니다. 학습 데이터가 공개되지 않으면 해당 모델은 오픈 소스가 아니라 오픈 웨이트입니다.
- Llama는 오픈 소스인가요?
- 아닙니다 — Llama는 커뮤니티 라이선스 하의 오픈 웨이트입니다. Meta는 학습 데이터를 공개하지 않으며, 라이선스에는 허용 사용 정책, 월 7억 명 활성 사용자 기준, 그리고 출력을 경쟁 모델 학습에 사용하는 것에 대한 제한이 포함됩니다. OSI를 비롯한 여러 기관은 이를 소스 공개(source-available) 또는 오픈 웨이트로 분류하며, 오픈 소스로 보지 않습니다.
- OSI 오픈 소스 AI 정의란 무엇인가요?
- 2024년 10월에 발표된, 오픈 소스 AI의 최초 안정 버전 정의입니다. 사용, 연구, 수정, 공유라는 네 가지 자유를 부여하고, 세 가지 구성 요소를 요구합니다: 데이터 정보, 완전한 학습 및 추론 코드, 모델 파라미터. 특히 원시 데이터셋 자체가 아니라 학습 데이터에 관한 상세한 정보를 요구한다는 점이 주목할 만합니다.
- 오픈 소스 AI는 학습 데이터를 공개해야 하나요?
- 원시 데이터셋은 아닙니다 — OSI 정의는 숙련된 사람이 실질적으로 동등한 시스템을 구축할 수 있을 만큼 충분히 상세한 데이터 정보를 요구하며, 실제 데이터는 법적으로 가능한 경우에만 요구합니다. 이 타협은 정의에서 가장 논란이 많은 부분입니다. 진정한 재현 가능성에는 데이터 자체가 필요하다는 주장이 있기 때문입니다.
- 오픈 웨이트 모델을 무료로 상업적으로 이용할 수 있나요?
- 대부분 가능하지만, 전적으로 라이선스에 달려 있습니다. Apache-2.0 모델(많은 Qwen 및 Mistral 릴리스)은 제한 없는 상업적 이용을 허용합니다. Llama의 커뮤니티 라이선스는 상업적 이용을 허용하지만 사용자 수 상한과 기타 제한이 있습니다. 일부 변형은 비상업적 전용입니다. 상업적으로 배포하기 전에 반드시 해당 모델의 라이선스를 확인하세요.
- 진정한 오픈 소스 AI 모델은 어떤 것이 있나요?
- 가중치와 함께 학습 데이터 및 완전한 학습과 추론 코드를 공개하는 모델입니다 — Ai2의 OLMo가 대표적인 예로, 코퍼스, 코드, 로그, 체크포인트를 공개합니다. 인기 있는 "오픈" 모델 대부분(Llama, Qwen, Mistral, DeepSeek)은 오픈 웨이트이며, 최소한 학습 데이터는 비공개입니다.
- Apache-2.0 모델은 오픈 소스와 같은가요?
- Apache-2.0은 정식 오픈 소스 라이선스이므로 Apache-2.0 가중치는 상업적으로 제한이 없고 허용적입니다. 그러나 Apache-2.0 가중치를 가진 모델이라도 학습 데이터 정보와 코드가 함께 공개되지 않는 한 OSI AI 정의에 따른 완전한 "오픈 소스"는 아닙니다 — 따라서 허용적 라이선스의 오픈 웨이트라고 표현하는 것이 가장 정확합니다.
Sources