Sonnet 5 vs Opus 4.8: quando cambiare modello nel tuo sistema
Guida operativa su Sonnet 5: benchmark reali, pricing window fino al 31 agosto, e quando conviene usarlo al posto di Opus 4.8.
Cosa è cambiato con Sonnet 5
Il 30 giugno 2026 Anthropic ha rilasciato Claude Sonnet 5. Da oggi è il modello default su tutti i piani, incluso Claude Code.
Due numeri che contano:
- Terminal-Bench 2.1: 67,0% → 80,4% (+13,4 punti). È il benchmark che misura quanto il modello riesce a lavorare da solo nel terminale, task multi-step, uso degli strumenti, esecuzione autonoma.
- Knowledge work (GDPval-AA v2): 1.618 Elo vs Opus 4.8 a 1.615. Sonnet 5 supera il modello grande sui task analitici e di scrittura strutturata.
Il pricing window
Fino al 31 agosto 2026, Sonnet 5 ha prezzi intro:
- $2 per milione di token in input
- $10 per milione di token in output
Dal 1° settembre i prezzi salgono a $3/$15. Hai due mesi per testarlo e consolidarlo nella tua pipeline al prezzo più basso.
Quando usare Sonnet 5 e quando tenere Opus 4.8
Usa Sonnet 5 adesso se:
- il tuo sistema fa task agentici nel terminale (Terminal-Bench +13pp lo rende sensibilmente più affidabile)
- hai pipeline di analisi o scrittura strutturata (knowledge work: batte Opus 4.8 a parità di costo molto più basso)
- vuoi ridurre il costo senza sacrificare qualità sui task standard
- usi Claude Code: da oggi Sonnet 5 è il default, nessuna config necessaria
Tieni Opus 4.8 se:
- hai task di coding agentico complesso dove il benchmark Opus conta ancora (Opus 4.8 fa 69,2% vs Sonnet 5 a 63,2% su agentic coding)
- hai già un sistema calibrato su Opus 4.8 e non vuoi rischiare regressioni prima di testare
La capacità che cambia le pipeline
Sonnet 5 si auto-controlla senza che glielo chiedi esplicitamente. Significa meno supervisione manuale, meno prompt di verifica, pipeline più compatte. Nei test di Anthropic, completa task complessi dove i modelli precedenti si fermavano a metà.
Come aggiornare
Se usi l'API diretta: aggiorna il model ID a claude-sonnet-5. Se usi Claude Code: è già il default da oggi, nessuna modifica. Se hai prompt calibrati su Sonnet 4.6, testa su un subset prima di migrare tutto.
Il consiglio pratico: prendi un task agentico del tuo sistema che Sonnet 4.6 completava all'80%, giralo su Sonnet 5, misura. I 13 punti di Terminal-Bench non sono astratti.