SERRA – Strategia e lancio digitale

Il ranking cambia verdetto se cambi l’ordine dei dati

Scritto daMi chiamo Roberto Serra e mi occupo di SEO (Search Engine Optimization) e GEO (Generative Engine Optimization): lavoro sul posizionamento nei motori di ricerca, sulla visibilità nelle risposte generate dall'AI e sulle entità che la rendono possibile.

La stabilità decisionale degli scorer di ranking dipende dall’ordine dei dati in input

Il 65,4% che trasforma l’ordine in verdetto

Il dato più scomodo non riguarda modelli mediocri. Su reranking di passaggi, cinque scorer addestrati entro 0,010 di nDCG@10 — la metrica con cui si giudica la qualità di una classifica — producono, quando vengono riordinati, insiemi di ritenzione che si sovrappongono solo per 0,66-0,84. In pratica: due versioni dello stesso modello, che differiscono solo per l’ordine in cui leggono i candidati, trattengono una quota rilevante di elementi diversi.

Il confronto non risparmia i modelli già pubblicati. Un reranker consolidato ottiene la più alta F1 dell’insieme di ritenzione nel confronto e si sovrappone comunque solo per 0,667. Tradotto: chi eccelle sulla metrica classica non è necessariamente stabile quando deve decidere davvero. L’ordine di input, da solo, può invertire quale risposta diventa un’etichetta di addestramento in una quota ampia di query per i modelli di ricompensa e preferenza.

È qui che la questione smette di essere tecnica. La selezione dei modelli basata solo sulla qualità del ranking — l’nDCG — può portare a scegliere scorer instabili proprio a livello di decisioni: la ritenzione oltre una soglia, le risposte ai lettori, le scelte di preferenza. E il monito che accompagna i dati è esplicito: i punteggi sono stime graduate di rilevanza, non giudizi di veridicità o legali, e non vanno usati per decisioni ad alto rischio sulle persone.

Resta la domanda di fondo: perché un semplice riordino dei candidati produce questi ribaltamenti? Per capirlo serve guardare dentro ai due approcci dominanti.

Punto per punto o lista intera: il punto cieco è lo stesso

Da una parte ci sono i modelli pointwise: cross-encoder come monoT5 e RankLLaMA restituiscono un valore per ciascun candidato, ma ne elaborano uno per volta. È l’esaminatore che legge un curriculum alla volta: valuta ogni documento isolatamente, e il giudizio finale dipende da quale documento arriva prima.

Dall’altra ci sono i reranker listwise generativi come RankGPT e RankZephyr: condizionano su più candidati congiuntamente, ma emettono una lista ordinata senza punteggi per singolo candidato. È l’esaminatore che guarda l’intera pila di curriculum ma restituisce solo una classifica, senza voti individuali. In entrambe le architetture, il punto cieco è lo stesso: l’ordine di presentazione orienta il giudizio finale.

Se il problema è strutturale, finora l’unica contromisura consolidata è stata costosa. Come indicato da Korikov et al. (2025), il rimedio è mediare i punteggi dello stesso pool su più permutazioni: funziona, ma moltiplica il costo di servizio per il numero di permutazioni usate.

OC-SFT e il confine da non superare

Il metodo descritto nel paper prova ad aggirare quel costo. OC-SFT — order-consistency SFT — agisce già in fase di addestramento: insegna al punteggio di un candidato a non dipendere dall’ordine in cui compare. La qualità della classifica, sostengono gli autori, resta intatta; e su dodici modelli base il metodo si rivela più stabile della distillazione con media di ordine.

La tesi è misurata: una singola permutazione dopo l’addestramento OC-SFT mantiene insiemi che si sovrappongono più di dieci permutazioni mediate di modelli standard. È posizionato proprio contro il metodo Batched Self-Consistency: la coerenza a livello di peso, secondo gli autori, batte la media di dieci permutazioni in termini di stabilità decisionale.

Il confine, però, resta. OC-SFT riduce la dipendenza dall’ordine nei pesi del modello; non trasforma i punteggi in giudizi. La domanda aperta non è se il metodo scalerà, ma se chi progetta ricerca e sistemi di AI continuerà a trattare questi punteggi come giudici automatici. Perché un ranking, alla fine, diventa una decisione.

Se un ordine diverso cambia il verdetto, ogni score va trattato per quello che è: una stima fragile, non una sentenza. La ricerca ora ha un metodo per ridurre la fragilità; chi pubblica e chi decide ha un motivo in più per non delegare giudizi ad alto impatto a una lista ordinata.

L'autore

Roberto Serra

Mi chiamo Roberto Serra e mi occupo di SEO (Search Engine Optimization) e GEO (Generative Engine Optimization): lavoro sul posizionamento nei motori di ricerca, sulla visibilità nelle risposte generate dall'AI e sulle entità che la rendono possibile.

Ricevi i migliori aggiornamenti su SEO

Già +6.200 professionisti iscritti · una mail a settimana, zero spam
✦ Iniziamo

Mercato, richieste e concorrenti. Scopri le potenzialità del tuo business. Dati alla mano.

Qui è dove ha inizio il tuo lancio digitale.