Vai al contenuto
Liguori
§ 00 | GIOVANNI
Costruisco automazioni AI con Claude per PMI e freelancer italiani. 21 sistemi in produzione, zero dipendenti, 60+ ore/mese risparmiate. Stack: Python, GCP.
ACCEPTING NEW CLIENTS
Risorse · DM · MODELLI

GPT-5.6 Luna, Terra, Sol: come confrontare i tre tier con il tuo stack

Guida pratica per valutare i tier di GPT-5.6 e ChatGPT Work: calcolo costi, confronto architetturale Responses API vs Messages API, e come fare un test valido in meno di un giorno

Commenta MODELLI sotto il reel|16 luglio 2026|Giovanni Liguori
Contenuto assistito da AI

I tre tier, in breve

  1. Luna - $1 input / $6 output per milione di token. Il tier più economico, ottimizzato per velocità. Adatto a task ad alto volume e bassa latenza critica.
  2. Terra - $2.50 input / $15 output. Bilanciato tra capacità e costo. Confrontabile con GPT-5.5 a metà prezzo, secondo OpenAI.
  3. Sol - $5 input / $30 output. Il tier di frontiera. Per lavoro agentico complesso, reasoning profondo, task che richiedono il massimo della capacità.

ChatGPT Work: cosa fa davvero

ChatGPT Work è l'agent lanciato insieme a GPT-5.6. Non è un assistente che risponde: esegue workflow interi. Dall'analisi di un problema, passa alla produzione di output finiti: documenti, fogli di calcolo, web app.

Funziona su Codex e GPT-5.6, con orchestrazione multi-agent in beta sulla Responses API: fino a 8 sub-agent in parallelo per call.

Il confronto diretto è con i workflow agentic che già usi.

Come valutare il confronto per il tuo caso

Prima di fare test o integrazioni, tre domande concrete.

1) Quale tier regge il tuo volume?

Fai questo calcolo: stima il numero di token mensili del tuo workflow principale. Moltiplica per il prezzo del tier che consideri.

  • Luna: 10 milioni di token/mese = $10 input + $60 output (se rapporto input/output 1:1)
  • Terra: stesso volume = $25 input + $150 output
  • Sol: stesso volume = $50 input + $300 output

Se il tuo workflow genera molto output (es. generazione documenti lunghi), il costo output pesa di più.

2) L'architettura della Responses API cambia il tuo setup?

Responses API gestisce stato, tool use e orchestrazione multi-agent in modo nativo. Se il tuo codice usa Claude API (Messages API), passare a Responses API richiede una riscrittura del layer di integrazione.

Domanda pratica: quanto del tuo codice dipende dai pattern Messages API? Se usi pattern semplici (prompt in, output fuori), la migrazione è più lineare. Se usi sub-agent, context passing e tool orchestration, valuta il costo di riscrittura prima.

3) ChatGPT Work produce gli output che ti servono?

ChatGPT Work è ottimizzato per output finiti: doc, sheet, web app. Se il tuo workflow richiede output strutturati che poi processi con codice, potresti avere un layer di finitura che non ti serve.

Confronta il tipo di output del tuo workflow attuale con quello che ChatGPT Work produce: se coincidono, vale la pena testare. Se divergono, il vantaggio principale diventa irrilevante per il tuo caso.

Cosa NON guardare

Il benchmark sintetico. I numeri SWE-bench, MMLU e simili non dicono nulla su come il modello si comporta sui tuoi task specifici. Il parametro che conta è il costo per output utile nel tuo workflow reale.

Come fare un test valido in meno di un giorno

  1. Prendi un task che già funziona nel tuo sistema attuale
  2. Invia lo stesso prompt a Luna, Terra e Sol via API
  3. Misura: qualità output, latenza, costo per run
  4. Confronta con il costo dello stesso task nel tuo stack attuale

Non serve un test su scala: 20-30 run su un task reale bastano per capire se il modello è nella zona di competenza del tuo caso d'uso.

In sintesi

GPT-5.6 porta una fascia media più competitiva (Terra a $2.50/M input) e un'opzione di frontiera (Sol) per task agentic complessi. ChatGPT Work aggiunge un layer di agent nativo che prima non c'era nell'ecosistema OpenAI.

Se già hai un workflow AI in produzione, il test vale la pena. Se stai partendo, valuta prima quale architettura ti dà meno attrito con il codice che già scrivi.

GPT-5.6 Luna, Terra, Sol: come confrontare i tre tier con il tuo stack | Giovanni Liguori