Le regole del digitale stanno cambiando.
O sei visibile o sei fuori. Noi ti aiutiamo a raggiungere i clienti giusti — quando ti stanno cercando.
Contattaci oraStesso prezzo per token del predecessore, ma la misurazione indipendente rileva un costo per task più alto, perché il modello genera molti più token di output
Claude Sonnet 5.5 di Anthropic raggiunge il 70,6% su Terminal-Bench 4.0 e completa Pokémon Red dai soli screenshot. Il salto di capacità rispetto al predecessore, fermo al 10,3%, promette automazione più economica per attività, con costi per task inferiori fino al 30%. Resta però il dubbio sollevato da Artificial Analysis: il modello si colloca fuori dalla frontiera di Pareto, e la concorrenza di GPT-6 Sol spinge il confronto sul costo effettivo, non sul listino.
È di ieri la notizia: un modello di Anthropic ha appena finito Pokémon Red guardando solo screenshot, e il suo punteggio su Terminal-Bench è passato dal 10,3% al 70,6%. Non è fantascienza. È Claude Sonnet 5.5, il secondo modello della famiglia Claude 5.5 appena annunciato da Anthropic.
Partiamo dai numeri. Terminal-Bench 4.0 è una valutazione di coding agentico, cioè quanto bene un modello se la cava con compiti di programmazione lunghi e articolati: il predecessore Sonnet 5 si fermava al 10,3%, Sonnet 5.5 arriva al 70,6%. In più, è il primo modello Sonnet a completare Pokémon Red lavorando solo da screenshot. Non è un traguardo da gamer: per riuscirci il modello deve leggere lo stato a schermo e prendere decisioni in sequenza, senza accesso al codice del gioco. Anthropic lo presenta come un chiaro upgrade rispetto a Sonnet 5: genera output oltre il 30% più velocemente, il che ne fa il modello Sonnet più rapido finora. Fin qui, sono i numeri dichiarati dall’azienda. Ma dietro questi numeri c’è una domanda: quanto costa davvero questo salto?
Il paradosso del costo per task
Il prezzo per token resta identico a quello di Sonnet 5: 2 dollari per milione di token in ingresso, 10 dollari per milione in uscita e 20 centesimi per le letture della cache. Il risparmio del 30% è però una stima di Anthropic, che nei propri test rileva un costo fino al 30% inferiore per attività, non per token, grazie al minor numero di token necessari per lo stesso lavoro. La misurazione indipendente di Artificial Analysis indica l’opposto: il modello costerebbe circa il 50% in più per attività rispetto a Sonnet 5, perché genera molti più token di output per raggiungere i suoi punteggi. Il prezzo per token è la cifra che vedi nel listino; il costo per attività è quello che esce dal conto alla fine del mese. La differenza non è solo contabile: cambia il parametro con cui misurare l’efficienza.
Ed è qui che il confronto con la concorrenza complica il quadro. Secondo Artificial Analysis, il costo per task di Claude Sonnet 5.5 va da 0,41 dollari a 7,60 dollari a seconda del livello di sforzo, dalla configurazione bassa a quella massima. E a questo prezzo, sempre secondo Artificial Analysis, il modello si colloca fuori dalla frontiera di Pareto tra intelligenza e costo per task. La frontiera di Pareto è il punto in cui ogni euro in più compra un aumento di qualità che vale la pena; stare fuori significa che qualcun altro offre di più per lo stesso prezzo, o lo stesso per meno.
Il confronto con OpenAI è ancora più diretto. Secondo quanto riportato da OpenAI, GPT‑6 Sol con sforzo xhigh supera Claude Opus 5 con sforzo massimo su AutomationBench costando appena il 9% del costo per task di Opus 5. Non parliamo di Sonnet 5.5, ma il messaggio è chiaro: la partita si gioca sul costo per task, non sul prezzo per token. Un modello può costare poco per token e consumarne così tanti da diventare caro; un altro può costare di più per token e chiudere il lavoro in poche chiamate. Se Sonnet 5.5 non è sulla frontiera di Pareto, cosa lo rende interessante per chi sviluppa? Un indizio c’è: secondo Artificial Analysis, la configurazione con sforzo alto è la più competitiva, con un’intelligenza di pochissimo inferiore a GPT‑6 Sol a parità di costo per task.
La prossima mossa di Anthropic
La risposta potrebbe essere già in arrivo. Anthropic ha mostrato un ritmo serrato: l’uscita di Opus 5 a luglio 2026 seguita da Opus 5.5 appena due mesi dopo, come riportato da TechCrunch. E già nell’annuncio di Opus 5.5, Anthropic scriveva che Claude Sonnet 5.5 e Claude Haiku 5.5 sarebbero seguiti nelle settimane successive con miglioramenti simili a prestazioni, efficienza e sicurezza. Sonnet 5.5 è arrivato ieri, in linea con quella tabella di marcia.
Per chi fa impresa online, il messaggio è: non fermarti al prezzo per token; misura il costo per task e confronta con GPT‑6 Sol. Sonnet 5.5 non è il più efficiente in assoluto, ma il suo salto di capacità a costi contenuti potrebbe cambiare i margini dell’automazione.
