Per tre anni il ragionamento è stato lineare: i modelli chiusi sono più bravi, quelli scaricabili costano meno. Nel luglio 2026 questa frase non regge più. Il modello aperto più forte sul mercato costa più di un modello chiuso che lo batte sull’indice di intelligenza, e il modello aperto più economico costa un cinquantesimo del primo.
Confrontiamo tre modelli con licenza aperta o annunciata come tale: Kimi K3 (Moonshot AI), GLM-5.2 (Zhipu, marchio Z.ai) e DeepSeek V4.
I numeri
| Metrica | Kimi K3 | GLM-5.2 | DeepSeek V4 |
|---|---|---|---|
| Architettura | 2,8T MoE | 744B MoE, 40B attivi | MoE (variante Pro-Max) |
| Licenza | non ancora pubblicata, pesi attesi il 27 luglio | MIT | MIT |
| Contesto | 1,05M token | 1M token | 1M token sulla variante Flash |
| Prezzo (input / output per 1M token) | 3,00 $ / 15,00 $ | circa 1,10 $ / 4,10 $ | 0,14 $ / 0,28 $ (V4-Flash) |
| AA Intelligence Index | 57 | 51 | non pubblicato per V4-Pro-Max |
| SWE-bench Verified | 93,4% (Vals AI) | non riportato | 80,6% (vendor, Pro-Max) |
| Terminal-Bench | 88,3% su 2.1 (harness KimiCode) | 81,0% su 2.0 | non riportato |
| GPQA | 93,5% | 91,2% | non riportato |
| Humanity’s Last Exam | 56,0% | 54,7% | non riportato |
Per riferimento, i modelli chiusi in cima all’Intelligence Index v4.1 di Artificial Analysis: Claude Opus 5 a 61 (5 $ / 25 $), Claude Fable 5 a 60, GPT-5.6 Sol a 59.
Le tre cose che questa tabella dice
Il divario tecnico si è chiuso quasi del tutto. Kimi K3 sta a 57 sull’Intelligence Index contro il 61 di Claude Opus 5. Quattro punti. Nel 2024 il ritardo dei modelli scaricabili sul frontier si misurava in dodici o diciotto mesi. Oggi si misura in poche settimane e in una manciata di punti indice.
Il vantaggio di prezzo, in alto, è sparito. Kimi K3 costa 3 $ e 15 $ per milione di token. Claude Opus 5, che lo batte su quasi tutto, costa 5 $ e 25 $. Il rapporto è meno di due a uno, mentre l’aspettativa storica per un modello aperto era un ordine di grandezza. Moonshot ha prezzato K3 come un prodotto frontier, non come un’alternativa economica, e la scelta è coerente: 2,8 trilioni di parametri non si servono a buon mercato. Artificial Analysis misura K3 intorno ai 34 token al secondo sull’API di Moonshot, con circa sette secondi di time to first token.
Il valore sta nella fascia media. DeepSeek V4-Flash a 0,14 $ e 0,28 $ con un milione di token di contesto è nella stessa tabella di Kimi K3, e costa poco più dell’uno per cento in input. GLM-5.2 a circa 1,10 $ e 4,10 $ porta un indice 51 con licenza MIT senza restrizioni. Fra i modelli chiusi, Artificial Analysis calcola per Grok 4.5 un costo di circa 0,31 $ per task dell’Intelligence Index, cinque volte meno di Claude Sonnet 5.
Cosa significa davvero “aperto” oggi
Tre modelli, tre significati diversi della stessa parola.
GLM-5.2 è aperto nel senso pieno. Licenza MIT, pesi scaricabili, nessuna restrizione d’uso, fine tuning e ispezione consentiti. Con 40 miliardi di parametri attivi è anche realisticamente servibile in casa da un’infrastruttura di dimensioni normali.
Kimi K3 è aperto in senso annunciato. I pesi sono attesi per il 27 luglio 2026, la licenza non è ancora stata pubblicata. E anche quando arriveranno, 2,8 trilioni di parametri richiedono cluster GPU multi nodo: è alla portata di chi ha già quel tipo di infrastruttura, non di un team che vuole fare un esperimento su un singolo pod.
DeepSeek V4 è aperto e leggero. MIT, self hostable, con una variante Flash quasi gratuita. Paga sui benchmark di punta ma vince ovunque il volume conti più dell’ultimo punto percentuale.
L’architettura che sta emergendo
Il pattern che si sta consolidando nelle installazioni reali non è “scegli un modello”. È il routing: un modello aperto ed economico gestisce fra il 72% e il 96% del traffico, un modello frontier chiuso raccoglie i casi difficili, un gateway sta davanti a entrambi. Le analisi su carichi di lavoro reali riportano che questa configurazione batte entrambi i modelli presi singolarmente, sia sulla qualità sia sul costo.
Il contesto macroeconomico aiuta a capire perché. Il Token Price Index di BenchLM segna 12 a luglio 2026 su una base 100 a marzo 2023: l’88% in meno, con una mediana di 4,50 $ per milione di token blended su tredici modelli di punta. La capacità di livello GPT-4, che nel 2023 costava circa 30 $ per milione di token, oggi si compra sotto il dollaro.
In pratica
Se il vostro carico di lavoro è ad alto volume e a bassa difficoltà, la scelta economicamente razionale non è più il modello aperto più forte: è il modello aperto più piccolo che supera la vostra soglia di qualità, con un fallback frontier per il resto.
Se invece vi serve un modello scaricabile per ragioni di sovranità del dato, conformità o fine tuning, GLM-5.2 è oggi l’opzione più solida: licenza pulita, dimensione gestibile, punteggi verificati.
Kimi K3 vale la pena di essere seguito per una ragione sola, ma importante: se i pesi e la licenza arrivano davvero, sarà il primo modello scaricabile con punteggi frontier verificati da terzi. Il 27 luglio è la data da guardare.
Lascia un commento