Storia Progetti Blog Consulenza Scrivimi →
Home › Blog › Hugging Face: cos'è, a cosa serve e quanto costa nel 2026
AI Tools

Hugging Face: cos'è, a cosa serve e quanto costa nel 2026

6 min lettura
Hugging Face: cos'è, a cosa serve e quanto costa nel 2026 — Raffaele Mele

In breve: Hugging Face è la piattaforma centrale dell'AI open source: un archivio (Hub) con milioni di modelli, dataset e demo, più servizi per usarli. Navigare e scaricare è gratis. Per farli girare esistono i Spaces (applicazioni web ospitate), gli Inference Endpoints (macchine dedicate a ore) e gli Inference Providers, un'API unica compatibile con OpenAI che instrada le richieste a decine di fornitori senza sovrapprezzo di Hugging Face.

Se hai letto di modelli come Hermes, DeepSeek o GLM con i "pesi aperti", è qui che li trovi. Vediamo a cosa serve ogni parte e quanto costa.

Le quattro cose da distinguere

  • Hub: il catalogo dove pubblicare e scaricare modelli, dataset e demo. Gratis per navigare e scaricare.
  • Spaces: piccole applicazioni ospitate (Gradio, Docker e simili). C'è un livello gratuito con CPU di base e ZeroGPU; le macchine potenti si pagano a ore.
  • Inference Endpoints: distribuisci un modello su una macchina dedicata, pagata a ore.
  • Inference Providers: un'API unica per usare modelli serviti da partner esterni, pagando a token.

Inference Providers: l'API unica

È la parte più utile per chi sviluppa. Un solo token di Hugging Face dà accesso a modelli serviti da partner come Cerebras, Groq, Together, Fireworks, Novita, Z.ai, Replicate e altri, con un'interfaccia compatibile con OpenAI. Cambi l'indirizzo base in https://router.huggingface.co/v1 e scrivi l'identificativo del modello.

const client = new OpenAI({
  baseURL: 'https://router.huggingface.co/v1',
  apiKey: process.env.HF_TOKEN,
});

await client.chat.completions.create({
  model: 'organizzazione/modello:fastest',
  messages: [{ role: 'user', content: 'Ciao' }],
});

Il suffisso decide la scelta del fornitore: :fastest (predefinito, massima velocità), :cheapest (il più economico per token in output) oppure :preferred (il tuo ordine di preferenza). Puoi anche indicare direttamente il provider, ad esempio :groq. Se scegli la selezione automatica, il sistema passa a un provider alternativo quando il primo non risponde. Non ci sono ricarichi rispetto ai prezzi dei provider, e c'è un livello gratuito con crediti aggiuntivi per gli abbonati PRO e per Team ed Enterprise.

Chi usa agenti di coding trova nella documentazione guide dedicate per collegarli: sono elencati Claude Code, Codex, OpenCode, Pi e Hermes Agent.

Prezzi (settembre 2026)

PianoCostoCosa cambia
Free$0Hub, Spaces con CPU di base e ZeroGPU, livello gratuito di inference
PRO$9/mesePiù spazio privato, 20 volte i crediti di inference, più quota ZeroGPU, possibilità di ospitare Spaces Gradio e Docker
Team$20/utente/meseSSO, controllo sulla posizione dei dati, audit, controllo degli accessi
Enterprise$50/utente/meseProvisioning SCIM, limiti più alti, supporto dedicato

A parte ci sono i costi a consumo: gli Spaces vanno da $0,03 all'ora (CPU potenziata) a $23,50 all'ora (8 GPU L40S); gli Inference Endpoints da $0,03 all'ora su CPU, con GPU che vanno da $0,50 all'ora (T4) a $5 all'ora (H200). Lo spazio di archiviazione parte da $12 al terabyte al mese per i repository pubblici e $18 per quelli privati.

Quando usarlo

  • Scaricare un modello aperto per farlo girare in locale (per esempio con Ollama) o su un tuo server: l'Hub è il punto di partenza. Pesi e licenze si leggono nella scheda del modello, e la licenza va sempre controllata prima di un uso commerciale.
  • Provare un modello aperto senza installare nulla: Inference Providers o il playground.
  • Pubblicare una demo: uno Space è il modo più rapido per far provare un modello o uno strumento.
  • Distribuire un modello in produzione su una macchina dedicata: Inference Endpoints.

Hugging Face o OpenRouter?

OpenRouter è un gateway pensato per chi vuole un unico punto di accesso a modelli commerciali e aperti, con fatturazione unificata e instradamento. Hugging Face è più ampio: è il posto dove i modelli aperti nascono e si scaricano, e Inference Providers è il ponte per usarli via API. Se il tuo obiettivo è cambiare modello al volo in un agente, OpenRouter è più immediato; se vuoi anche ospitare, scaricare o studiare i pesi, Hugging Face è la casa naturale.

I modelli aperti di cui parliamo qui sono, per esempio, Hermes, DeepSeek V4 e GLM.

Fonti

Risorsa gratuita

Vuoi iniziare con l'AI?

Scarica la guida AI da Zero — PDF gratuito, pratico, senza tecnicismi.

Domande frequenti
Cos'è Hugging Face?
È la piattaforma centrale dell'AI open source: un Hub con milioni di modelli, dataset e demo, più servizi per usarli come Spaces, Inference Endpoints e Inference Providers.
Hugging Face è gratis?
L'Hub è gratuito per navigare e scaricare, e c'è un livello gratuito per Spaces (CPU di base e ZeroGPU) e per l'inference. I piani a pagamento partono da PRO a $9 al mese; le macchine e l'uso intensivo si pagano a consumo.
Cosa sono gli Inference Providers?
Un'API unica, compatibile con OpenAI, che instrada le richieste a decine di fornitori (Groq, Together, Fireworks, Z.ai e altri) con un solo token di Hugging Face e senza ricarico sui prezzi dei provider.
Come scelgo il provider con Inference Providers?
Aggiungendo un suffisso al nome del modello: :fastest (predefinito) per la massima velocità, :cheapest per il costo minore, :preferred per il tuo ordine di preferenza, oppure il nome di un provider specifico.
Quanto costa un Inference Endpoint?
Si paga a ore: da circa $0,03 all'ora su CPU e da $0,50 all'ora per una GPU T4 fino a $5 all'ora per una H200, secondo il listino di Hugging Face.
Posso usare Hugging Face con Claude Code o Codex?
Sì: la documentazione di Inference Providers ha guide per collegare agenti come Claude Code, Codex, OpenCode, Pi e Hermes Agent, per usare modelli aperti con un solo token.