In breve: GLM è la famiglia di modelli di Z.ai (Zhipu). Nel 2026 è passata da GLM-5 (12 febbraio) a GLM-5.1, 5.2 e 5.3, fino a GLM-5.3-Flash del 26 agosto: un modello con 320 miliardi di parametri totali ma solo 18 miliardi attivi, contesto da 1 milione di token, capacità visive native e un prezzo di $0,15 per milione di token in input e $0,50 in output. È pensato per il codice, ma anche per documenti d'ufficio, analisi finanziaria e uso del computer.
Se lavori con agenti di coding e ti serve un modello capace ma economico, GLM è tra le opzioni da tenere d'occhio. Ecco la cronologia e, soprattutto, cosa cambia con la variante Flash.
Cronologia dei rilasci
- GLM-5 (12 febbraio 2026): passa dall'accento sul codice a quello sull'ingegneria del software; usa una forma di attenzione sparsa per risparmiare token.
- GLM-5.1 (7 aprile): pensato per il lavoro autonomo prolungato, fino a 8 ore in una sola esecuzione tra pianificazione, esecuzione, correzione e consegna.
- GLM-5.2 (16 giugno): contesto da 1 milione di token senza perdite e prestazioni migliori su compiti lunghi.
- GLM-5.3 (18 agosto): Z.ai dichiara un +50% su GLM-5.2 nel proprio benchmark di codice, e capacità in cybersicurezza (2.436 vulnerabilità trovate in prove su casi reali, di cui 1.097 di gravità media o alta).
- GLM-5.3-Flash (26 agosto): la variante più leggera e la prima della serie con visione nativa.
GLM-5.3-Flash nel dettaglio
| Caratteristica | Valore |
|---|---|
| Parametri | 320 miliardi totali, 18 miliardi attivi per token |
| Architettura | Attenzione ibrida che combina meccanismi lineari e sparsi (novità per la serie GLM) |
| Contesto / output | 1 milione di token / fino a 128.000 token |
| Input | Testo, immagini, video, file |
| Output | Solo testo |
| Funzioni | Chiamata di funzioni, output JSON strutturato, cache del contesto, uso del computer, streaming |
| Ragionamento | Sempre attivo (non si può disattivare) |
Rispetto a GLM-5.3, Z.ai dichiara che l'attenzione richiede circa un terzo del calcolo e che la memoria per la cache si riduce di 4,4 volte. La variante FlashX punta a 200 token al secondo.
Prezzi (dollari per milione di token)
| Modello | Input | Input in cache | Output |
|---|---|---|---|
| GLM-5.3-Flash | 0,15 | 0,03 | 0,50 |
| GLM-5.3-FlashX | 0,37 | 0,075 | 1,25 |
| GLM-5.3 (e 5.2, 5.1) | 1,40 | 0,26 | 4,40 |
| GLM-5 | 1,00 | 0,20 | 3,20 |
Flash costa circa un decimo di GLM-5.3 in input. In più, sul piano abbonamento per gli strumenti di coding Z.ai indica una quota triplicata per Flash, con consumo dimezzato negli orari non di picco.
Cosa dichiara Z.ai sulle prestazioni
- Su DeepSWE 1.1 GLM-5.3-Flash ottiene 63,4 contro 46,2 di GLM-5.2.
- Su AutomationBench ottiene 48,8 contro 26,2.
- Sul benchmark di codice di Z.ai è vicinissimo a Claude Opus 4.8 (29,0 contro 29,5).
- Sull'Artificial Analysis Intelligence Index ottiene 57, a un costo di circa $0,045 per compito.
Sono numeri del produttore, su benchmark scelti dal produttore, e il confronto è con Opus 4.8, non con l'ultimo Opus 5.5. Tienili come indicazione, non come verdetto.
Per cosa è pensato
La documentazione elenca otto scenari: programmare a partire da screenshot di interfacce, produrre documenti d'ufficio (presentazioni, PDF, Word, Excel), analisi e modelli finanziari, comprensione di video, creazione di scene 3D con Blender, sviluppo di giochi con Godot, operazioni con controllo del computer e riproduzione di modelli CAD. La novità pratica è la visione: per la prima volta nella serie puoi dargli uno screenshot e chiedere di costruire l'interfaccia.
Come si usa
- API di Z.ai: i codici modello sono
glm-5.3-flasheglm-5.3-flashx. - Piano abbonamento per il coding: pensato per usare GLM dentro strumenti di sviluppo come Claude Code o Cursor.
- Gateway: si trova anche su OpenRouter e su altri provider, e Z.ai è tra i fornitori di Hugging Face Inference Providers.
- Pesi aperti: secondo le fonti specializzate i pesi di Flash sono pubblicati con licenza MIT, ma la documentazione ufficiale che ho letto non lo dice: verifica prima di un uso commerciale.
Una nota personale, da prendere per quello che è: nel mio uso con un agente di coding, GLM 5.2 servito tramite un gateway mi ha dato interruzioni per inattività, mentre la 5.1 andava senza problemi. Prima di affidare un flusso importante a un modello nuovo, conviene fare qualche giorno di prove.
Fonti
Risorsa gratuita
Vuoi iniziare con l'AI?
Scarica la guida AI da Zero — PDF gratuito, pratico, senza tecnicismi.