Il 22 settembre Anthropic ha rilasciato Claude Opus 5.5. È la prima volta che il modello più capace è anche quello che costa meno fra i modelli di punta — e la prima volta che una parte del prompt engineering che hai imparato quest'anno smette di servire.
Cosa è cambiato il 22 settembre
Opus 5.5 è il primo modello della famiglia 5.5 — Sonnet 5.5 e Haiku 5.5 arrivano nelle settimane successive. Tre cose insieme, ed è raro che succedano insieme: è il più capace su lavoro di conoscenza e su task agentici, costa il 40% in meno di Opus 5 sullo stesso carico, e scrive in modo diverso.
Il dettaglio tecnico che cambia il modo di parlargli è uno solo: il ragionamento è sempre attivo e non si può disattivare. Contesto da un milione di token, output massimo 128k, cinque livelli di sforzo.
I numeri, letti bene
La riga da guardare, se non scrivi codice, non è quella sui benchmark di programmazione: è GDPval-AA, che misura il lavoro di conoscenza. Lì Opus 5.5 sta a 1846 punti Elo contro i 1735 di Fable 5.1, i 1708 di Opus 5 e i 1542 di GPT-6 Astra.
Sui test agentici il distacco è più netto: 66,4% su Terminal-Bench 4.0, contro il 55,8% di Fable 5.1 e il 57,9% di GPT-6 Astra. Ma il dato che vale come regola pratica è un altro: a effort medio, cioè al livello di default, Opus 5.5 batte GPT-6 Astra al suo effort massimo, spendendo circa un quinto per task.
La nota sotto la tabella che quasi nessuno riporta
Salvo dove indicato, i risultati di Opus 5.5 nella tabella ufficiale sono misurati a effort massimo. E in alcuni test le protezioni di sicurezza hanno spostato il lavoro su modelli più vecchi — Opus 4.8 per la cybersecurity, Opus 5 per la biologia — il che, per ammissione di Anthropic, abbassa il punteggio di Opus 5.5 su quelle prove.
La riga da cancellare dai tuoi prompt
«Ragiona passo passo» adesso lavora contro di te. Il modello ragiona comunque, sempre, e non puoi spegnere quel comportamento: chiederglielo non aggiunge qualità, allunga solo l'attesa prima della prima parola. Vale per tutte le varianti — pensa attentamente, think step by step, ragiona con calma.
Il punto è che va tolta anche dai prompt salvati e dalle istruzioni personalizzate, non solo da quello che scrivi oggi. È lì che quelle righe continuano a girare senza che tu ci pensi.
Stessa sorte per un'altra abitudine: «sii creativo», «non farmi una cosa generica». Non dicono niente di azionabile. Al loro posto funziona l'esclusione esplicita — elencare quello che non vuoi vedere: niente sfondi crema, niente parole in corsivo per enfasi, niente etichette numerate delle sezioni, niente bottoni a pillola.
E la terza: spezzare il lavoro in cinque messaggi. Opus 5.5 rende di più se gli dai il compito intero in un messaggio solo e lo lasci correre.
Le due righe da aggiungere
Sono quelle che trasformano una richiesta in un incarico.
1. La definizione di "fatto"
«Fatto vuol dire: [condizione 1], [condizione 2] e [condizione 3]. Vai avanti finché non sono tutte vere.»
Senza questa riga il modello si ferma dove pensa che tu sia soddisfatto. Con questa riga si ferma dove lo sei davvero.
2. La regola di stop
«Quando un passaggio non ha bisogno di me, vai avanti, e metti le note di stato nello stesso messaggio in cui fai la cosa dopo. Fermati e chiedi solo se non puoi continuare senza di me, o prima di qualsiasi cosa irreversibile: cancellare dati, mandare qualcosa a qualcuno, toccare roba fuori da questo progetto.»
La seconda è nata per Claude Code — si mette nel file CLAUDE.md — ma funziona identica come istruzione personalizzata nella chat normale.
Ricevi la GUIDA OPERATIVA completa a Claude Opus 5.5
Il confronto con Fable 5.1 e GPT-6 Astra numeri alla mano, i 5 prompt da provare, i livelli di effort e la tabella costi aggiornata. Compila in 10 secondi.
I cinque livelli di effort
Low, medium (default), high, xhigh, max. Decidono quanto il modello ragiona prima di rispondere, e quindi anche quanto paghi. La regola pratica sta in quattro righe:
- Low — lavoro meccanico con istruzioni chiare. Un'azienda in accesso anticipato citata da Anthropic riporta che a effort minimo Opus 5.5 ha trovato il 72% dei bug noti nelle revisioni di codice, contro il 56% di Opus 5 a effort alto.
- Medium — il default, e il 90% del lavoro vero. Basta questo per stare davanti agli altri modelli al massimo.
- High e xhigh — quando i vincoli da tenere insieme sono tanti. Costa circa 0,40 dollari in più a task, cioè quanto un singolo tentativo rifatto.
- Max — quando il costo dell'errore è più alto del costo del token.
Non alzarlo per abitudine: paghi di più e aspetti di più per un guadagno che sul lavoro normale non vedi. E se anche high sbatte due volte sullo stesso problema, la mossa giusta è cambiare modello, non salire ancora.
Quanto costa davvero una sessione
Il listino è la parte facile: 4 dollari per milione di token in ingresso e 20 in uscita, contro i 5 e 25 di Opus 5. Con il batch si dimezza: 2 e 10.
La voce che cambia il conto, però, è un'altra: la lettura dalla cache, scesa a 0,20 dollari, cioè il 5% del prezzo d'ingresso invece del 10% standard.
Il numero che ribalta tutto
Stessa sessione, 2,8 milioni di token in ingresso: 1,62 dollari con il 90% di letture dalla cache, 11,20 senza. Sette volte tanto, a parità di lavoro fatto. La cache non è un dettaglio da sviluppatori: è quasi tutto il tuo conto.
E la cache si rompe più facilmente di quanto pensi. La riscrittura scatta quando cambi il livello di effort, quando cambi modello, quando colleghi o scolleghi un server MCP, quando compatti la conversazione, o quando ti fermi più a lungo della sua durata — un'ora sull'abbonamento, cinque minuti via API.
Da qui la regola che vale più di ogni altra: i cambi di modello e di effort falli a una pausa naturale, non a metà di un lavoro. Per avere il numero tuo e non quello di un articolo, a fine sessione chiedi /usage: ti dice token in ingresso, in uscita (il ragionamento è fatturato come output), letture dalla cache e la stima in dollari.
Quale modello per cosa
Con i prezzi nuovi la vecchia regola — modello costoso solo dove serve — resta valida, ma cambia la mappa:
- Capire il task e fare il piano → Opus 5.5. È dove il giudizio conta e dove un errore si propaga su tutto il resto.
- Ricerca, bozze, lettura di log, riassunti → Sonnet 5 o Haiku 4.5. Costano una frazione e sul lavoro meccanico la differenza non si vede.
- Lavori lunghi che non stai a guardare, problemi senza uno schema, design audace → Fable 5.1. Sono gli unici posti dove vale ancora due volte e mezzo il prezzo.
- Controllo finale → Opus 5.5 a effort alto. Trova cose che agli altri sfuggono.
Il "Claudish", e perché riguarda chi scrive
Anthropic ha dato un nome al problema e dichiara di averlo sistemato. Il Claudish è quel modo di scrivere riconoscibile a un chilometro: le stesse strutture, le stesse parole, lo stesso ritmo, in qualunque testo e con qualunque prompt.
Tre cambiamenti, con le loro parole: mette l'informazione più importante in cima, usa meno gergo e meno frasi idiosincratiche, e segue le regole di scrittura che gli dai tu invece delle sue. L'ultima è quella che conta: fino a Opus 5 le tue regole reggevano due paragrafi, poi il modello tornava a casa sua.
La prova si fa in sei minuti. Scrivi cinque regole di stile precise e verificabili — frasi sotto le quindici parole, niente elenchi puntati, mai la parola «soluzione», sempre un numero nel primo paragrafo, chiudi senza riassumere — e dai lo stesso brief a Opus 5 e a Opus 5.5. Poi conta quante ne rispettano, riga per riga. In coda al prompt aggiungi: «elenca le regole che non sei riuscito a rispettare e spiega perché». Quella risposta ti dice anche se il modello sa di aver sgarrato.
Domande frequenti
Conviene passare a Claude Opus 5.5 o restare su Fable 5.1?
Per quasi tutto conviene Opus 5.5, e per la prima volta la risposta e anche quella che costa meno. Opus 5.5 sta davanti a Fable 5.1 su tutti i test pubblicati da Anthropic e costa 4 dollari per milione di token in ingresso contro 10, e 20 in uscita contro 50. Fable 5.1 resta la scelta giusta in tre casi: lavori lunghi che non stai a guardare, problemi che nel materiale non hanno uno schema riconoscibile, e il design piu audace.
Devo davvero togliere «ragiona passo passo» dai miei prompt?
Si. In Opus 5.5 il ragionamento e sempre attivo e non si puo disattivare, quindi chiederlo non aggiunge qualita: allunga solo il tempo prima della prima parola. Lo scrive Anthropic nella sua guida al modello. Vale anche per le varianti: pensa attentamente, think step by step, ragiona con calma. Vanno tolte dai prompt salvati e dalle istruzioni personalizzate, non solo da quello che scrivi oggi.
Quanto costa Claude Opus 5.5?
Quattro dollari per milione di token in ingresso e venti in uscita, contro i cinque e venticinque di Opus 5. La voce che cambia di piu e la lettura dalla cache: 0,20 dollari contro 0,50, cioe il 5% del prezzo d'ingresso invece del 10% standard. Con il batch si dimezza tutto: 2 e 10. Su un carico di lavoro tipico Anthropic dichiara un costo inferiore del 40% rispetto a Opus 5.
Che cos'e il livello di effort e quale conviene usare?
E quanto il modello ragiona prima di rispondere, e si sceglie fra low, medium, high, xhigh e max. Medium e il default e copre la gran parte del lavoro: a medium Opus 5.5 supera GPT-6 Astra al massimo sforzo sul lavoro di conoscenza. Si sale a high solo quando medium si pianta, e costa circa 0,40 dollari in piu a task. Se anche high sbatte due volte sullo stesso problema conviene cambiare modello, non alzare ancora.
Perche la cache pesa cosi tanto sul costo di una sessione?
Perche ogni turno rimanda tutta la conversazione, e rileggerla dalla cache costa un ventesimo rispetto a rileggerla da zero. Nei numeri di Anthropic la stessa sessione da 2,8 milioni di token in ingresso costa 1,62 dollari con il 90% di letture dalla cache e 11,20 senza. La cache si riscrive quando cambi effort, cambi modello, colleghi o scolleghi un server MCP, compatti la conversazione o ti fermi piu a lungo della sua durata: un'ora sull'abbonamento, cinque minuti via API.
Opus 5.5 scrive meglio dei modelli precedenti?
Scrive in modo meno riconoscibile, che per chi produce contenuti e la stessa cosa. Anthropic ha dato un nome al problema, il Claudish, e dichiara tre cambiamenti: mette l'informazione importante in cima, usa meno gergo e frasi idiosincratiche, e soprattutto segue le regole di scrittura che gli dai tu invece delle sue. La prova sta in due minuti: dagli cinque regole di stile verificabili e conta quante ne rispetta fino in fondo.
Serve saper programmare per usare Opus 5.5?
No. Il modello e lo stesso nella chat di Claude, in Claude Code e nelle app collegate: quello che cambia e come gli parli. Le tre cose che contano di piu sono alla portata di chiunque: dargli il lavoro intero in un messaggio solo, dirgli quando ha finito, e dirgli quando fermarsi a chiedere. Il resto della guida serve a spendere meno e a non aspettare inutilmente.