← Resources
By Ren Sugaya
— Performance Engineer, GPU & Inference
·
· INSIGHT
Modelli IA a pesi aperti vs. open source: qual è la differenza?
La maggior parte dei modelli presentati come "open source" sono in realtà a pesi aperti: i pesi sono scaricabili, ma i dati di addestramento e le libertà complete della licenza no. Questo articolo spiega la distinzione, la Definizione di IA Open Source dell'OSI, dove si collocano i modelli più diffusi sullo spettro e perché l'etichetta conta per l'uso commerciale.
La distinzione fondamentale
"Pesi aperti" significa che i parametri addestrati del modello sono scaricabili, ma i dati di addestramento, il codice di addestramento o le libertà complete della licenza possono essere omessi. L'"IA open source", secondo la definizione ufficiale, richiede inoltre informazioni sui dati e il codice di addestramento e inferenza, il tutto sotto termini aperti. Senza la divulgazione dei dati di addestramento, una pubblicazione è a pesi aperti, non open source.
Questo conta perché i due termini vengono costantemente confusi. Un modello che puoi scaricare ed eseguire non è automaticamente "open source" nel senso inteso dal mondo del software — e la differenza emerge esattamente dove conta di più: diritti commerciali, riproducibilità e ciò che sei effettivamente autorizzato a fare.
La Definizione di IA Open Source dell'OSI
Nell'ottobre 2024 l'Open Source Initiative ha pubblicato la prima Definizione di IA Open Source stabile. Concede quattro libertà — usare il sistema per qualsiasi scopo senza autorizzazione, studiarne il funzionamento, modificarlo per qualsiasi scopo e condividerlo con o senza modifiche — e richiede tre componenti: informazioni sui dati (dettagli sufficienti per costruire un sistema sostanzialmente equivalente), il codice completo di addestramento e inferenza e i parametri del modello.
Il suo compromesso più controverso è che non richiede la pubblicazione del dataset di addestramento grezzo — solo informazioni sufficientemente dettagliate su di esso. I critici lo definiscono un indebolimento; i sostenitori sottolineano che i vincoli legali e di privacy spesso rendono impossibile pubblicare i dati grezzi. In ogni caso, è questo il metro con cui le affermazioni di "open source" devono essere valutate.
Dove si collocano davvero i modelli più diffusi
La maggior parte dei modelli "aperti" ben noti sono a pesi aperti, non open source:
- Llama è a pesi aperti sotto una licenza comunitaria: Meta non pubblica i dati di addestramento, e la licenza aggiunge una policy di uso accettabile, una clausola di 700 milioni di utenti attivi mensili e restrizioni sull'uso degli output per addestrare modelli concorrenti. Non soddisfa la libertà di "usare per qualsiasi scopo senza autorizzazione", quindi è a sorgente disponibile, non open source. (Consulta la nostra [guida a Llama](/articles/run-llama-locally-hardware-guide).)
- Qwen e Mistral pubblicano molti modelli sotto Apache-2.0, una vera licenza open source sui pesi che consente un uso commerciale permissivo; tuttavia, senza dati e codice completi restano comunque "pesi aperti con licenza permissiva" anziché aperti secondo l'OSAID. (Consulta la nostra [guida a Qwen3](/articles/run-qwen3-locally-guide).)
- OLMo (di Ai2) è il riferimento per il vero aperto: pesi più il corpus di addestramento completo, il codice di addestramento, i log e i checkpoint.
- DeepSeek è a pesi aperti: i pesi sono pubblicati, ma i dati di addestramento non sono divulgati.
Lo spettro delle licenze
È utile pensare a uno spettro dal più al meno aperto:
- Completamente aperto / allineato all'OSAID: pesi più dati più codice (OLMo).
- Licenza OSI permissiva sui pesi: Apache-2.0 (Qwen, Mistral) — pesi senza restrizioni commerciali, ma senza divulgazione completa di dati/codice.
- "Comunitaria" restrittiva / sorgente disponibile: Llama — uso commerciale consentito ma con limiti, regole di uso accettabile e restrizioni per i concorrenti.
- Solo non commerciale / solo ricerca: alcune varianti di modelli si limitano all'uso non commerciale.
- Solo API / chiuso: i pesi non vengono mai pubblicati.
Sapere dove si colloca un modello indica cosa puoi legalmente farne — che è la domanda pratica, più che sapere se merita l'etichetta "open source".
Perché conta e l'"open-washing"
L'etichetta ha conseguenze reali. I termini della licenza — limiti di utenti attivi mensili, divieti per campo d'uso, clausole di non distillazione — determinano direttamente la legalità commerciale. L'open source (in senso stretto) consente inoltre di riprodurre e verificare un modello, il che conta per la fiducia e la ricerca. E la regolamentazione alza la posta in gioco: il Regolamento sull'IA dell'UE concede alcune esenzioni ai sistemi open source, quindi definire "open source" un modello a pesi aperti non è solo approssimativo — può avere conseguenze concrete.
Questo è il cuore della critica all'"open-washing": commercializzare un modello come open source quando nel migliore dei casi è a pesi aperti. Studi sui sistemi di IA generativa hanno rilevato che molte etichette "open source" sono in realtà a pesi aperti, e la tendenza generale lo conferma: la quota di download di modelli che divulgano i dati di addestramento è calata drasticamente, il che significa che l'ecosistema si sta orientando verso i pesi aperti, non verso l'open source.
Come osFoundry gestisce la questione
osFoundry esegue modelli a pesi aperti indipendentemente da dove si trovino sullo spettro: i permissivi Apache-2.0 (Qwen, Mistral), quelli con licenza comunitaria restrittiva (Llama) e i completamente aperti (OLMo) funzionano tutti allo stesso modo tramite BYOK o self-hosting. Poiché la questione "aperto versus pesi aperti" è in fondo una questione di licenze, osFoundry mostra i termini di licenza effettivi di ciascun modello — le clausole di limite utenti, le regole di non distillazione e le restrizioni non commerciali — così che i team possano verificare la legalità commerciale prima del deployment. Con BYOK e il self-hosting mantieni i pesi, i dati e l'inferenza sotto il tuo controllo anziché dietro l'API di un fornitore, e questo è il vantaggio pratico dell'"aperto", a prescindere dal fatto che un dato modello superi o meno il rigoroso standard open source.
Frequently asked questions
- Qual è la differenza tra un modello IA a pesi aperti e uno open source?
- Pesi aperti significa che i parametri addestrati del modello sono scaricabili, ma i dati di addestramento, il codice o le libertà della licenza possono essere omessi. Open source (secondo la definizione OSI) richiede inoltre informazioni sui dati e il codice di addestramento/inferenza sotto termini aperti. Se i dati di addestramento non sono divulgati, il modello è a pesi aperti, non open source.
- Llama è open source?
- No — Llama è a pesi aperti sotto una licenza comunitaria. Meta non pubblica i dati di addestramento, e la licenza aggiunge una policy di uso accettabile, una soglia di 700 milioni di utenti attivi mensili e restrizioni sull'uso degli output per addestrare modelli concorrenti. L'OSI e altri lo classificano come a sorgente disponibile o a pesi aperti, non open source.
- Cos'è la Definizione di IA Open Source dell'OSI?
- Pubblicata nell'ottobre 2024, è la prima definizione stabile di IA open source. Concede quattro libertà — usare, studiare, modificare e condividere — e richiede tre componenti: informazioni sui dati, codice completo di addestramento e inferenza e i parametri del modello. Da notare che richiede informazioni dettagliate sui dati di addestramento anziché il dataset grezzo.
- L'IA open source richiede la pubblicazione dei dati di addestramento?
- Non il dataset grezzo — la definizione OSI richiede informazioni sui dati sufficientemente dettagliate perché una persona qualificata possa costruire un sistema sostanzialmente equivalente, e i dati reali solo quando legalmente possibile. Questo compromesso è la parte più dibattuta della definizione, poiché la vera riproducibilità richiederebbe probabilmente i dati stessi.
- Posso usare modelli a pesi aperti commercialmente senza pagare?
- Spesso sì, ma dipende interamente dalla licenza. I modelli Apache-2.0 (molte versioni di Qwen e Mistral) consentono un uso commerciale senza restrizioni. La licenza comunitaria di Llama consente l'uso commerciale ma con un limite di utenti e altre restrizioni. Alcune varianti sono solo per uso non commerciale. Controlla sempre la licenza specifica del modello prima del deployment commerciale.
- Quali modelli IA sono veramente open source?
- I modelli che pubblicano i pesi insieme ai dati di addestramento e al codice completo di addestramento e inferenza — OLMo di Ai2 è l'esempio di riferimento, in quanto pubblica il suo corpus, il codice, i log e i checkpoint. La maggior parte dei modelli "aperti" più diffusi (Llama, Qwen, Mistral, DeepSeek) sono a pesi aperti e trattengono almeno i dati di addestramento.
- Un modello Apache-2.0 equivale a open source?
- Apache-2.0 è una vera licenza open source, quindi i pesi sotto Apache-2.0 sono permissivi e senza restrizioni commerciali. Ma un modello con pesi sotto Apache-2.0 non è ancora del tutto "open source" secondo la definizione IA dell'OSI a meno che non vengano pubblicate anche le informazioni sui dati di addestramento e il codice — quindi è meglio descritto come pesi aperti con licenza permissiva.
Sources