Le regole del digitale stanno cambiando.
O sei visibile o sei fuori. Noi ti aiutiamo a raggiungere i clienti giusti — quando ti stanno cercando.
Contattaci oraLo sconto vale per i prefissi riutilizzati entro trenta minuti
OpenAI ha annunciato uno sconto fino al 90% sui token di input in cache, validi per i prefissi condivisi riutilizzati entro 30 minuti. La mossa sposta la competizione dalla potenza dei modelli alla gestione della cache, con risparmi dichiarati da Copilot e Manus. I dati però provengono dall'azienda stessa e non da verifiche indipendenti.
OpenAI ha appena cambiato l’economia dei token. Ieri, 22 settembre 2026, secondo l’annuncio ufficiale di OpenAI, l’azienda offre sconti fino al 90% sui token di input in cache. Non è un ritocco marginale. I primi numeri di chi usa questi modelli in produzione mostrano che la partita si sta spostando dalla potenza dei modelli alla gestione della cache: Copilot e Manus hanno già cifre interessanti.
Il 90% che riscrive i costi
Partiamo dai numeri, perché sono il segnale più chiaro. Secondo Eugene Mikhantyev, un cliente ha portato il tasso di cache hit nelle valutazioni dall’83% al 91% in meno di una settimana, con cache write ridotti di circa due terzi e costi di inferenza ridotti del 36%. Tradotto per chi non mastica il gergo tecnico: il cache hit è quando una richiesta riusa qualcosa che il modello ha già elaborato poco prima, e non paga di nuovo per rifare lo stesso lavoro. Un terzo in meno sulla bolletta dei calcoli, senza toccare la qualità delle risposte.
Poi c’è GitHub Copilot. Mario Rodriguez riferisce che la piattaforma ha ridotto di oltre il 50% la quota di prompt token che richiedono elaborazione ex novo rispetto alla baseline precedente, su miliardi di richieste ai modelli OpenAI. E Bin Fan racconta che in meno di una settimana il tasso di cache hit di Manus sui modelli OpenAI è passato da circa l’85% a stabilmente sopra il 90%.
Attenzione, però. Questi numeri arrivano dall’annuncio di OpenAI, quindi sono casi scelti dall’azienda. Vanno presi per quello che sono: risultati dichiarati, non audit indipendenti. La direzione, però, è coerente con la meccanica dello sconto. E qui viene la domanda giusta: come si arriva a un risparmio del genere? La risposta sta in una finestra temporale molto precisa.
La meccanica dello sconto
Dietro il 90% c’è una regola semplice. Lo sconto vale per i prefissi condivisi riutilizzati entro una finestra di 30 minuti. In pratica, se una parte della richiesta — il prefisso, cioè l’inizio del prompt che si ripete tra una chiamata e l’altra — viene riusata da più richieste vicine nel tempo, OpenAI non la rielabora da capo e la fattura molto meno.
Il divario economico è netto. Come riporta il blog di Visual Studio Code, per la maggior parte dei modelli OpenAI i token non in cache costano 10 volte quelli in cache. In altre parole, se il messaggio entra nella cache, paghi un decimo. Questo cambia i calcoli per chi costruisce servizi AI: la scelta di come strutturare i prompt non è più solo tecnica, è una voce di bilancio.
Il confronto con il passato aiuta a capire dove sta andando OpenAI. Già il 1° ottobre 2024, l’azienda aveva introdotto il Prompt Caching con uno sconto del 50% e tempi di elaborazione più rapidi, riutilizzando i token di input recenti sui modelli GPT-4o e o1. Oggi lo sconto arriva al 90%: quasi il doppio. Non è un dettaglio, è un incentivo strutturale.
La concorrenza e l’impatto reale
Le regole degli altri sono diverse, e vale la pena guardarle prima di considerare OpenAI l’unica opzione. Stando alla documentazione di Claude, la cache ha una durata di vita di 5 minuti per impostazione predefinita — contro i 30 minuti di OpenAI — e viene aggiornata senza costi aggiuntivi ogni volta che il contenuto in cache viene utilizzato. Google ha scelto un’altra strada ancora: come si legge nella documentazione della Gemini API, per tutti i modelli Gemini 2.5 e successivi la cache implicita è abilitata per impostazione predefinita, quindi il riuso avviene senza configurazione da parte di chi sviluppa.
Il cerchio si chiude. Il risparmio è reale solo se cambiano le architetture: chi fa impresa online non deve più solo scegliere il modello più potente, ma progettare flussi che riusino il più possibile i prefissi condivisi. Il margine, oggi, si gioca lì.
