In breve: Hugging Face è la piattaforma centrale dell'AI open source: un archivio (Hub) con milioni di modelli, dataset e demo, più servizi per usarli. Navigare e scaricare è gratis. Per farli girare esistono i Spaces (applicazioni web ospitate), gli Inference Endpoints (macchine dedicate a ore) e gli Inference Providers, un'API unica compatibile con OpenAI che instrada le richieste a decine di fornitori senza sovrapprezzo di Hugging Face.
Se hai letto di modelli come Hermes, DeepSeek o GLM con i "pesi aperti", è qui che li trovi. Vediamo a cosa serve ogni parte e quanto costa.
Le quattro cose da distinguere
- Hub: il catalogo dove pubblicare e scaricare modelli, dataset e demo. Gratis per navigare e scaricare.
- Spaces: piccole applicazioni ospitate (Gradio, Docker e simili). C'è un livello gratuito con CPU di base e ZeroGPU; le macchine potenti si pagano a ore.
- Inference Endpoints: distribuisci un modello su una macchina dedicata, pagata a ore.
- Inference Providers: un'API unica per usare modelli serviti da partner esterni, pagando a token.
Inference Providers: l'API unica
È la parte più utile per chi sviluppa. Un solo token di Hugging Face dà accesso a modelli serviti da partner come Cerebras, Groq, Together, Fireworks, Novita, Z.ai, Replicate e altri, con un'interfaccia compatibile con OpenAI. Cambi l'indirizzo base in https://router.huggingface.co/v1 e scrivi l'identificativo del modello.
const client = new OpenAI({
baseURL: 'https://router.huggingface.co/v1',
apiKey: process.env.HF_TOKEN,
});
await client.chat.completions.create({
model: 'organizzazione/modello:fastest',
messages: [{ role: 'user', content: 'Ciao' }],
});
Il suffisso decide la scelta del fornitore: :fastest (predefinito, massima velocità), :cheapest (il più economico per token in output) oppure :preferred (il tuo ordine di preferenza). Puoi anche indicare direttamente il provider, ad esempio :groq. Se scegli la selezione automatica, il sistema passa a un provider alternativo quando il primo non risponde. Non ci sono ricarichi rispetto ai prezzi dei provider, e c'è un livello gratuito con crediti aggiuntivi per gli abbonati PRO e per Team ed Enterprise.
Chi usa agenti di coding trova nella documentazione guide dedicate per collegarli: sono elencati Claude Code, Codex, OpenCode, Pi e Hermes Agent.
Prezzi (settembre 2026)
| Piano | Costo | Cosa cambia |
|---|---|---|
| Free | $0 | Hub, Spaces con CPU di base e ZeroGPU, livello gratuito di inference |
| PRO | $9/mese | Più spazio privato, 20 volte i crediti di inference, più quota ZeroGPU, possibilità di ospitare Spaces Gradio e Docker |
| Team | $20/utente/mese | SSO, controllo sulla posizione dei dati, audit, controllo degli accessi |
| Enterprise | $50/utente/mese | Provisioning SCIM, limiti più alti, supporto dedicato |
A parte ci sono i costi a consumo: gli Spaces vanno da $0,03 all'ora (CPU potenziata) a $23,50 all'ora (8 GPU L40S); gli Inference Endpoints da $0,03 all'ora su CPU, con GPU che vanno da $0,50 all'ora (T4) a $5 all'ora (H200). Lo spazio di archiviazione parte da $12 al terabyte al mese per i repository pubblici e $18 per quelli privati.
Quando usarlo
- Scaricare un modello aperto per farlo girare in locale (per esempio con Ollama) o su un tuo server: l'Hub è il punto di partenza. Pesi e licenze si leggono nella scheda del modello, e la licenza va sempre controllata prima di un uso commerciale.
- Provare un modello aperto senza installare nulla: Inference Providers o il playground.
- Pubblicare una demo: uno Space è il modo più rapido per far provare un modello o uno strumento.
- Distribuire un modello in produzione su una macchina dedicata: Inference Endpoints.
Hugging Face o OpenRouter?
OpenRouter è un gateway pensato per chi vuole un unico punto di accesso a modelli commerciali e aperti, con fatturazione unificata e instradamento. Hugging Face è più ampio: è il posto dove i modelli aperti nascono e si scaricano, e Inference Providers è il ponte per usarli via API. Se il tuo obiettivo è cambiare modello al volo in un agente, OpenRouter è più immediato; se vuoi anche ospitare, scaricare o studiare i pesi, Hugging Face è la casa naturale.
I modelli aperti di cui parliamo qui sono, per esempio, Hermes, DeepSeek V4 e GLM.
Fonti
Risorsa gratuita
Vuoi iniziare con l'AI?
Scarica la guida AI da Zero — PDF gratuito, pratico, senza tecnicismi.