Qwen3.8-Max: MoE da 2,4 trilioni di parametri e i benchmark dichiarati

Qwen3.8-Max è un Mixture of Experts da 2,4 trilioni di parametri con contesto fino a un milione di token, accessibile dal 3 agosto 2026 attraverso le API di Model Studio e la piattaforma QwenWork. I pesi aperti sono annunciati per la settimana prossima su Hugging Face e ModelScope, senza un giorno preciso e con licenza non definita. I benchmark pubblicati da Qwen, dove il quadro non è a senso unico, e la serie Max finora.

Open SourceAIOpen SourceQwenAlibabaLLMAIPesi ApertiMoEInferenza LocaleBenchmarkSovranità Digitale
Quattro dati tecnici su Qwen3.8-Max al 3 agosto 2026: 2,4 trilioni di parametri totali, architettura Mixture of Experts e contesto fino a un milione di token, accessibile via le API di Model Studio e dalla piattaforma QwenWork; pesi annunciati per la settimana prossima su Hugging Face e ModelScope, senza un giorno preciso e con licenza non definita, insieme a un Qwen3.8-27B dimensionato per GPU on-premise; salti su Qwen3.7-Max con FrontierSWE da 40,7 a 73,5, DeepSWE 1.1 da 21,6 a 56,6, JobBench da 31,3 a 53,4 e GPQA Diamond da 92,4 a 92,6, quindi i salti più grandi sono dove il modello era più debole; benchmark dichiarati da Qwen con PaperBench a 93,0, GPQA Diamond a 92,6, OmniDocBench 1.5 a 92,1 e IFBench a 82,8, senza verifiche indipendenti. In basso la nota che il quadro dichiarato non è a senso unico, perché su Terminal-Bench 2.1 Qwen si dà 86,6 contro gli 88,8 di GPT-5.6 Sol e su SWE-bench Pro 67,7 contro gli 80,0 di Fable 5
Lo stato del rilascio al 3 agosto. Fonti in fondo.

Oggi Alibaba ha reso Qwen3.8-Max accessibile agli sviluppatori di tutto il mondo attraverso le API di Model Studio e la piattaforma QwenWork, entrata oggi in beta pubblica su web e desktop. Il rilascio a pesi aperti è annunciato per la settimana prossima su Hugging Face e ModelScope.

Provarlo si può da oggi; ospitarlo in proprio dipende dai pesi, che ancora non sono stati pubblicati.

Cosa è disponibile da oggi

Il modello era stato presentato il 19 luglio 2026 alla World AI Conference di Shanghai come anteprima, raggiungibile solo tramite il Token Plan di Alibaba e le piattaforme Qoder e QoderWork, a un prezzo che le fonti indicano attorno al 10% del listino. Da oggi l’accesso avviene attraverso le API standard di Alibaba Cloud ed è aperto a tutti.

Le cifre sono quelle dichiarate dal fornitore, senza conferma indipendente: 2,4 trilioni di parametri totali, architettura Mixture of Experts, contesto fino a un milione di token e output massimo di 131.072 token. QwenWork entra in un settore già affollato, con Tencent WorkBuddy, Kimi Work di Moonshot, Claude Cowork e ChatGPT Work.

I numeri dichiarati

Al lancio Qwen ha pubblicato una tabella di confronto ampia. Questi sono i valori più citati, tutti misurati da Qwen:

BenchmarkQwen3.8-MaxConfronto dichiarato
PaperBench93,0GPT-5.6 Sol 90,5 · Fable 5 88,8
GPQA Diamond92,6GPT-5.6 Sol 94,1 · Qwen3.7-Max 92,4
OmniDocBench 1.592,1
Terminal-Bench 2.186,6GPT-5.6 Sol 88,8 · Claude Opus 4.8 84,6
OSWorld-Verified86,1
IFBench82,8GPT-5.6 Sol 72,7 · Fable 5 63,5
FrontierSWE73,5Fable 5 88,8
SWE-bench Pro67,7Fable 5 80,0

Il quadro dichiarato non è a senso unico, ed è la cosa più utile della tabella. Qwen sta davanti su IFBench, che misura l’aderenza alle istruzioni, e su PaperBench. Sta dietro a GPT-5.6 Sol su Terminal-Bench e dietro a Fable 5 di dodici punti su SWE-bench Pro e di quindici su FrontierSWE, cioè proprio sui compiti di ingegneria del software su repository reali.

I salti rispetto alla generazione precedente sono grandi dove il modello era debole: DeepSWE 1.1 passa da 21,6 a 56,6, FrontierSWE da 40,7 a 73,5 e JobBench da 31,3 a 53,4.

Tre avvertenze sulla lettura. I punteggi sono tutti di Qwen e non risultano riproduzioni indipendenti. Nei confronti multimodali il termine di paragone interno è Qwen3.7-Plus e non Max, quindi il miglioramento su quella parte va letto con cautela. E la curva di apprendimento per rinforzo mostrata nella documentazione tocca il massimo a 0,725 attorno a quattromila ambienti di addestramento e poi scende, che è un dettaglio più interessante di molti punteggi.

Sui parametri attivi circola la cifra di 95 miliardi, ripresa da più testate, ma Alibaba non l’ha divulgata. Conviene trattarla come una stima di terzi.

I quattro Max precedenti

La linea Max di Qwen è nata chiusa e finora è rimasta tale in tutte le sue uscite: Qwen3-Max-Preview nel settembre 2025, Qwen3.6-Max-Preview il 20 aprile 2026, Qwen3.7-Max il 20 maggio e Qwen3.8-Max-Preview il 19 luglio.

Fino a oggi la parte scaricabile della famiglia era di taglia molto diversa, dal ciclo Qwen3.6 in poi: modelli che stanno su una singola GPU, mentre uno da 2,4 trilioni di parametri richiede un’infrastruttura di tutt’altro ordine.

Se i pesi arrivano davvero, sarebbe la prima volta che un modello di classe Max esce dall’API. Insieme è annunciato anche un Qwen3.8-27B, descritto come un checkpoint dimensionato per hardware GPU on-premise ordinario, che è la parte del rilascio con più probabilità di finire davvero su macchine altrui.

Promesse e date

Nelle stesse settimane altri laboratori hanno fatto la stessa cosa in modo verificabile. Moonshot ha accompagnato Kimi K3 con una data dichiarata per i pesi. Poolside ha pubblicato Laguna S 2.1 il 21 luglio mettendo i pesi su Hugging Face lo stesso giorno, sotto licenza OpenMDW-1.1. DeepSeek ha rilasciato V4 Flash 0731 con i pesi su Hugging Face sotto MIT, scaricabili e ospitabili in proprio.

Ogni laboratorio ha vincoli suoi che dall’esterno non si vedono. Una promessa di apertura diventa però qualcosa su cui pianificare quando ci sono tre cose: un giorno, una licenza e una model card. Di Qwen3.8-Max al momento c’è un generico “la settimana prossima”.

Cosa ne pensiamo

Per chi valuta oggi un’adozione la situazione è semplice da leggere. Il modello si può provare via API, e se il compito è capire se regge sui propri casi d’uso l’API basta. Quello che non si può fare è progettarci sopra un sistema che deve tenere il dato dentro il perimetro, perché quella scelta dipende da un file che non esiste ancora e da una licenza che nessuno ha visto.

La differenza pesa come in Open Intelligence, Secure Governance: un modello a pesi aperti si può far girare su hardware proprio, come mostrano DwarfStar 4, colibri e KTransformers, e rende reversibile la scelta del fornitore. Un modello via API, per quanto buono, lascia quella leva in mano a qualcun altro.

Con 2,4 trilioni di parametri, poi, l’apertura dei pesi cambia meno di quanto sembri per la maggior parte delle aziende: pochi hanno l’hardware per ospitarlo. Conta però per chi costruisce servizi sopra questi modelli, e conta come segnale sul fatto che la frontiera a pesi aperti continui a esistere, come in pesi aperti e leadership americana.

Ci torneremo quando ci saranno il file, la licenza e una riproduzione indipendente dei numeri.

Fonti

Vuoi supporto?Sei sotto attacco?Stato dei servizi
Vuoi supporto?Sei sotto attacco?Stato dei servizi