In breve: DeepSeek ha oggi due modelli principali in API: deepseek-flash (la versione V4.1 Flash, con supporto nativo alle immagini, uscita il 10 settembre 2026) e deepseek-v4-pro (disponibile in versione stabile dal 13 agosto). Entrambi hanno un contesto di 1 milione di token e fino a 384.000 token di output. I prezzi sono tra i più bassi del mercato e, dal 16 agosto 2026, dimezzano nelle ore di minor traffico.
Chi ha usato DeepSeek un anno fa ricorda R1 e V3. La linea è cambiata: oggi si parla di famiglia V4. Ecco la sequenza dei rilasci e cosa conviene sapere per usarla.
La cronologia da aprile a settembre 2026
- 24 aprile: arrivano V4-Pro e V4-Flash, disponibili anche con le interfacce compatibili con OpenAI e Anthropic. I vecchi nomi
deepseek-chatedeepseek-reasonervengono programmati per la chiusura entro il 24 luglio. - 31 luglio: rilascio ufficiale di V4-Flash in beta pubblica, con capacità agentiche migliorate e supporto nativo all'API Responses per l'integrazione con OpenAI Codex.
- 13 agosto: V4-Pro esce in versione stabile, con più capacità da agente per l'uso in produzione, tre livelli di sforzo di ragionamento (basso, alto, massimo) e la nuova tariffazione con fasce di picco e non picco.
- 21 agosto: V4-Flash-Vision, una versione sperimentale con capacità visive.
- 10 settembre: V4.1 Flash, il modello più piccolo della famiglia con supporto multimodale nativo. Sostituisce i precedenti Flash e le vecchie sigle vengono instradate al nuovo modello.
V4-Pro resta disponibile anche oltre il 14 settembre, data per cui si temeva una chiusura, e la documentazione parla di una V4.1 Pro ancora da uscire.
Prezzi (dollari per milione di token)
| Modello | Input (cache hit) | Input (cache miss) | Output |
|---|---|---|---|
| deepseek-flash, fuori picco | 0,003 | 0,15 | 0,60 |
| deepseek-flash, in picco | 0,006 | 0,30 | 1,20 |
| deepseek-v4-pro, fuori picco | 0,022 | 0,66 | 1,98 |
| deepseek-v4-pro, in picco | 0,044 | 1,32 | 3,96 |
Le ore di picco sono dalle 01:00 alle 04:00 e dalle 06:00 alle 10:00 UTC, dal lunedì al venerdì, escluse le festività pubbliche cinesi. Tutto il resto, weekend compresi, è fuori picco e costa la metà. Per chi lavora dall'Italia, gran parte del mattino in orario lavorativo cade in picco: se hai carichi non urgenti, conviene spostarli alla sera o nel fine settimana.
Perché conta per chi costruisce agenti
- Costo: un milione di token in output con Flash fuori picco costa $0,60. Per fare un confronto, GPT-6 Luna costa $0,50 e i modelli di punta partono da $10-20. Per volumi alti su compiti standard è una leva enorme.
- Contesto lungo: 1 milione di token in ingresso e 384.000 in uscita permettono di lavorare su intere basi di codice o documenti lunghi.
- Compatibilità: le interfacce compatibili con OpenAI e Anthropic e l'API Responses permettono di collegarlo a strumenti come Codex e Claude Code senza riscrivere nulla, e a gateway come OpenRouter.
- Pesi aperti: secondo le fonti pubbliche la famiglia V4 ha pesi aperti con licenza MIT, quindi può essere ospitata in autonomia. Verifica sempre la licenza del modello specifico prima dell'uso commerciale.
Come usarlo
Ti serve una chiave dalla piattaforma DeepSeek e un client compatibile OpenAI. Cambi solo l'indirizzo base e il nome del modello (deepseek-flash o deepseek-v4-pro). I nomi vecchi (deepseek-chat, deepseek-reasoner) sono stati dismessi, quindi se hai script di un anno fa aggiornali. Se il tuo agente è OpenClaw o Hermes Agent, DeepSeek è uno dei modelli economici più adatti al lavoro di routine.
Limiti e cautele
- Dati e giurisdizione: è un servizio cinese. Per dati sensibili o clienti regolamentati valuta con attenzione dove passano i dati, oppure usa i pesi aperti su infrastruttura tua.
- Prezzi variabili: le fasce di picco sono una novità recente e i listini possono cambiare.
- Benchmark: le comparazioni pubbliche sono spesso del produttore. Prova il modello sul tuo compito.
Fonti
Risorsa gratuita
Vuoi iniziare con l'AI?
Scarica la guida AI da Zero — PDF gratuito, pratico, senza tecnicismi.