In breve: un agent harness è tutto ciò che circonda un modello linguistico per trasformarlo in un agente che agisce: il ciclo che lo richiama di continuo, gli strumenti che può usare, l'ambiente protetto in cui li esegue, la memoria che sopravvive tra una sessione e l'altra e le regole su cosa entra nel contesto. In parole povere, il modello è il cervello, l'harness è tutto il resto. Claude Code, Codex, OpenClaw e Hermes Agent sono harness.
Se ti sei chiesto perché lo stesso modello dia risultati diversi in strumenti diversi, la risposta è quasi sempre qui. Negli ultimi mesi la conversazione tra chi costruisce agenti si è spostata dal "quale modello" al "quale harness", e ci sono buoni motivi.
Cosa c'è dentro un harness
- Il ciclo: chiede al modello cosa fare, esegue, guarda il risultato e ricomincia finché il compito è finito o qualcosa lo ferma.
- Gli strumenti: leggere e scrivere file, lanciare comandi, cercare sul web, chiamare API, spesso collegati tramite MCP.
- L'ambiente di esecuzione: il sandbox in cui girano gli strumenti, che limita i danni.
- La memoria: file di istruzioni come CLAUDE.md, memoria a lungo termine e riassunti del contesto.
- I permessi e le regole: cosa richiede approvazione, cosa è vietato, cosa può essere automatizzato con gli hook.
- La gestione del contesto: cosa tenere, cosa riassumere, cosa scartare per non saturare la finestra del modello.
Una definizione sintetica che circola tra chi lavora con LangChain: l'harness è ogni pezzo di codice, configurazione e logica di esecuzione che non è il modello.
Perché conta più di quanto sembri
Alcuni risultati raccolti da un confronto pubblicato quest'anno, da leggere come indicazioni e non come verità assolute:
- Vercel ha ridotto gli strumenti dell'agente dell'80% e il tasso di successo, a parità di modello, è salito dall'80% al 100%.
- LangChain è passata dal 52,8% al 66,5% su Terminal Bench cambiando solo l'harness.
- Letta Code ha ottenuto 59,1% con Claude Opus 4.5, contro il 41,6% di Claude Code con lo stesso modello, grazie a un'architettura orientata alla memoria durevole.
Il messaggio è che il modello conta, ma la parte che ci costruisci intorno può contare altrettanto. Vale anche il contrario: un harness ottimo non salva un modello inadatto.
Gli harness che vale la pena conoscere
| Harness | Chi lo fa | Licenza | Modelli |
|---|---|---|---|
| Claude Code | Anthropic | Proprietaria | Solo Claude |
| Codex | OpenAI | Apache 2.0 (CLI) | Solo OpenAI |
| OpenCode | Anomaly | MIT | Oltre 75 provider |
| Qwen Code | Alibaba | Apache 2.0 | Più API e modelli locali |
| DeepSeek Harness | DeepSeek | MIT | A plugin |
| Goose | Linux Foundation (AAIF) | Apache 2.0 | Oltre 15 provider |
| OpenHands | All-Hands-AI | MIT | Qualsiasi modello, self-hosted |
La tabella riprende un confronto pubblicato da winder.ai; DeepSeek Harness risulta in anteprima per sviluppatori dal 13 agosto 2026, senza dichiarazioni di maturità per la produzione. A questi si aggiungono gli agenti che vivono sulla tua macchina, come OpenClaw e Hermes Agent, e l'orchestratore Paperclip, che coordina più agenti come un'azienda.
Harness dinamici: quando l'agente costruisce il proprio
La novità più discussa arriva da Claude Code con i "dynamic workflows". L'idea è che Claude non si limiti al percorso standard, ma scriva al volo un harness su misura per il compito: un programma che avvia e coordina più subagenti. Anthropic cita esempi con 14 agenti per una revisione, 6 per riprodurre un test, 22 per una ricerca; usi tipici sono le migrazioni divise in tanti agenti che correggono in parallelo, le ricerche con verifica avversariale di ogni affermazione e lo smistamento di grandi quantità di ticket.
Il rovescio della medaglia è il costo: questi flussi consumano molti token, quindi conviene fissare un budget massimo. E per il lavoro di programmazione ordinario non servono: Anthropic stessa sconsiglia un pannello di cinque revisori per un compito normale.
Come scegliere un harness
- Parti dal compito, non dalla moda: uno strumento per programmare (Claude Code, Codex), un assistente sulle chat (OpenClaw, Hermes Agent), una squadra di agenti (Paperclip).
- Guarda il vincolo sui modelli: gli harness dei grandi laboratori sono legati al loro fornitore; quelli aperti lasciano scegliere e permettono di usare modelli economici come DeepSeek o GLM.
- Prova sul tuo lavoro: due giorni sullo stesso compito con due harness dicono più di qualsiasi classifica.
- Non chiuderti dentro: tieni le istruzioni in file leggibili da più strumenti. Claude Code, per esempio, legge anche un file AGENTS.md, lo standard aperto nato con il contributo di OpenAI.
- Metti confini di sicurezza: sandbox, permessi minimi e approvazione per le azioni con effetti esterni.
E i modelli?
Il modello resta decisivo, e cambia di continuo: Claude Opus 5.5, GPT-6, DeepSeek, GLM. Anche modelli molto particolari come Jev trovano posto dentro un harness, per esempio come filtro di sicurezza veloce. Per questo conviene un harness che permetta di cambiare modello senza riscrivere tutto. Per le basi leggi anche cosa sono gli agenti AI.
Fonti
Risorsa gratuita
Vuoi iniziare con l'AI?
Scarica la guida AI da Zero — PDF gratuito, pratico, senza tecnicismi.