Storia Progetti Blog Consulenza Scrivimi →
Home › Blog › GLM 5.3 e GLM 5.3 Flash di Z.ai: novità, prezzi e come usarli
AI Tools

GLM 5.3 e GLM 5.3 Flash di Z.ai: novità, prezzi e come usarli

7 min lettura
GLM 5.3 e GLM 5.3 Flash di Z.ai: novità, prezzi e come usarli — Raffaele Mele

In breve: GLM è la famiglia di modelli di Z.ai (Zhipu). Nel 2026 è passata da GLM-5 (12 febbraio) a GLM-5.1, 5.2 e 5.3, fino a GLM-5.3-Flash del 26 agosto: un modello con 320 miliardi di parametri totali ma solo 18 miliardi attivi, contesto da 1 milione di token, capacità visive native e un prezzo di $0,15 per milione di token in input e $0,50 in output. È pensato per il codice, ma anche per documenti d'ufficio, analisi finanziaria e uso del computer.

Se lavori con agenti di coding e ti serve un modello capace ma economico, GLM è tra le opzioni da tenere d'occhio. Ecco la cronologia e, soprattutto, cosa cambia con la variante Flash.

Cronologia dei rilasci

  • GLM-5 (12 febbraio 2026): passa dall'accento sul codice a quello sull'ingegneria del software; usa una forma di attenzione sparsa per risparmiare token.
  • GLM-5.1 (7 aprile): pensato per il lavoro autonomo prolungato, fino a 8 ore in una sola esecuzione tra pianificazione, esecuzione, correzione e consegna.
  • GLM-5.2 (16 giugno): contesto da 1 milione di token senza perdite e prestazioni migliori su compiti lunghi.
  • GLM-5.3 (18 agosto): Z.ai dichiara un +50% su GLM-5.2 nel proprio benchmark di codice, e capacità in cybersicurezza (2.436 vulnerabilità trovate in prove su casi reali, di cui 1.097 di gravità media o alta).
  • GLM-5.3-Flash (26 agosto): la variante più leggera e la prima della serie con visione nativa.

GLM-5.3-Flash nel dettaglio

CaratteristicaValore
Parametri320 miliardi totali, 18 miliardi attivi per token
ArchitetturaAttenzione ibrida che combina meccanismi lineari e sparsi (novità per la serie GLM)
Contesto / output1 milione di token / fino a 128.000 token
InputTesto, immagini, video, file
OutputSolo testo
FunzioniChiamata di funzioni, output JSON strutturato, cache del contesto, uso del computer, streaming
RagionamentoSempre attivo (non si può disattivare)

Rispetto a GLM-5.3, Z.ai dichiara che l'attenzione richiede circa un terzo del calcolo e che la memoria per la cache si riduce di 4,4 volte. La variante FlashX punta a 200 token al secondo.

Prezzi (dollari per milione di token)

ModelloInputInput in cacheOutput
GLM-5.3-Flash0,150,030,50
GLM-5.3-FlashX0,370,0751,25
GLM-5.3 (e 5.2, 5.1)1,400,264,40
GLM-51,000,203,20

Flash costa circa un decimo di GLM-5.3 in input. In più, sul piano abbonamento per gli strumenti di coding Z.ai indica una quota triplicata per Flash, con consumo dimezzato negli orari non di picco.

Cosa dichiara Z.ai sulle prestazioni

  • Su DeepSWE 1.1 GLM-5.3-Flash ottiene 63,4 contro 46,2 di GLM-5.2.
  • Su AutomationBench ottiene 48,8 contro 26,2.
  • Sul benchmark di codice di Z.ai è vicinissimo a Claude Opus 4.8 (29,0 contro 29,5).
  • Sull'Artificial Analysis Intelligence Index ottiene 57, a un costo di circa $0,045 per compito.

Sono numeri del produttore, su benchmark scelti dal produttore, e il confronto è con Opus 4.8, non con l'ultimo Opus 5.5. Tienili come indicazione, non come verdetto.

Per cosa è pensato

La documentazione elenca otto scenari: programmare a partire da screenshot di interfacce, produrre documenti d'ufficio (presentazioni, PDF, Word, Excel), analisi e modelli finanziari, comprensione di video, creazione di scene 3D con Blender, sviluppo di giochi con Godot, operazioni con controllo del computer e riproduzione di modelli CAD. La novità pratica è la visione: per la prima volta nella serie puoi dargli uno screenshot e chiedere di costruire l'interfaccia.

Come si usa

  • API di Z.ai: i codici modello sono glm-5.3-flash e glm-5.3-flashx.
  • Piano abbonamento per il coding: pensato per usare GLM dentro strumenti di sviluppo come Claude Code o Cursor.
  • Gateway: si trova anche su OpenRouter e su altri provider, e Z.ai è tra i fornitori di Hugging Face Inference Providers.
  • Pesi aperti: secondo le fonti specializzate i pesi di Flash sono pubblicati con licenza MIT, ma la documentazione ufficiale che ho letto non lo dice: verifica prima di un uso commerciale.

Una nota personale, da prendere per quello che è: nel mio uso con un agente di coding, GLM 5.2 servito tramite un gateway mi ha dato interruzioni per inattività, mentre la 5.1 andava senza problemi. Prima di affidare un flusso importante a un modello nuovo, conviene fare qualche giorno di prove.

Fonti

Risorsa gratuita

Vuoi iniziare con l'AI?

Scarica la guida AI da Zero — PDF gratuito, pratico, senza tecnicismi.

Domande frequenti
Cos'è GLM-5.3-Flash?
È un modello di Z.ai uscito il 26 agosto 2026: 320 miliardi di parametri totali con 18 miliardi attivi, contesto da 1 milione di token, input di testo, immagini, video e file, e output testuale. È la prima variante della serie GLM-5 con visione nativa.
Quanto costa GLM-5.3-Flash?
$0,15 per milione di token in input, $0,03 per l'input in cache e $0,50 per l'output. La variante FlashX costa $0,37, $0,075 e $1,25 e punta a 200 token al secondo.
Qual è la differenza tra GLM-5.3 e GLM-5.3-Flash?
GLM-5.3 (18 agosto 2026) è il modello di punta a $1,40 in input e $4,40 in output. Flash è più leggero ed economico, con architettura ibrida di attenzione, visione nativa e quota maggiore nei piani per il coding, e secondo Z.ai supera GLM-5.2 nei test.
GLM-5.3-Flash è open source?
Le fonti specializzate parlano di pesi aperti con licenza MIT, ma la documentazione ufficiale consultata non lo specifica: controlla la licenza sul repository ufficiale prima di un uso commerciale.
Come si usa GLM con Claude Code o Cursor?
Z.ai vende un piano abbonamento per il coding pensato per usare i modelli GLM dentro strumenti di sviluppo come Claude Code e Cursor. Serve configurare lo strumento con l'indirizzo e la chiave forniti da Z.ai.
Quali sono le versioni di GLM uscite nel 2026?
GLM-5 (12 febbraio), GLM-5.1 (7 aprile), GLM-5.2 (16 giugno), GLM-5.3 (18 agosto) e GLM-5.3-Flash (26 agosto).