SERRA – Strategia e lancio digitale

Un’IA ha valutato 4.347 studi scientifici

Scritto da
Anita Innocenti
Sono una copywriter appassionata di search marketing. Scrivo testi pensati per farsi trovare, ma soprattutto per farsi scegliere. Le parole sono il mio strumento per trasformare ricerche in risultati.
✦ Fatti trovare

Le regole del digitale stanno cambiando.

O sei visibile o sei fuori. Noi ti aiutiamo a raggiungere i clienti giusti — quando ti stanno cercando.

Contattaci ora

Accordo alto sul protocollo, più basso sui risultati pubblicati

Un sistema basato su modelli linguistici, Kurate, ha analizzato 4.347 studi scientifici segnalando potenza statistica insufficiente, reporting selettivo e analisi non prespecificate come difetti ricorrenti. La scala del controllo automatico promette di affiancare la vigilanza editoriale, ma l'accordo con gli esperti cala proprio sulla pubblicazione dei risultati, dove il reporting selettivo produce i danni maggiori: resta un supporto, non un sostituto del giudizio umano.

Potenza statistica insufficiente, reporting selettivo, analisi non prespecificate: sono i difetti più frequenti che un sistema basato su modelli linguistici di grandi dimensioni ha individuato passando al setaccio 4.347 articoli scientifici, di cui 3.913 trial randomizzati. Il sistema si chiama Kurate ed è descritto in un preprint depositato su arXiv in questi giorni da Matthew J. Vowels e Jamie Cummins. In pratica, gli stessi modelli che generano testo vengono usati per controllare se uno studio pubblicato è stato disegnato e raccontato in modo credibile.

Il setaccio automatico

Kurate valuta ogni articolo su otto dimensioni del disegno e della reportistica dello studio. Su un corpus di 4.347 lavori, il risultato è un quadro che ora ha una scala quantitativa: i problemi più comuni riguardano la potenza statistica, il reporting selettivo e la prespecificazione dell’analisi. Non è un dettaglio: sono le dimensioni che decidono se un trial può essere considerato solido o se le sue conclusioni vanno prese con cautela.

La potenza statistica è la probabilità di individuare un effetto quando esiste davvero. Il reporting selettivo è la tendenza a riportare solo gli esiti favorevoli. La prespecificazione dell’analisi è la regola per cui gli esiti da misurare andrebbero decisi prima di iniziare, non scelti a posteriori. Kurate segnala questi difetti in automatico e su larga scala. Resta una domanda aperta: quanto sono affidabili le valutazioni generate da un algoritmo?

Perché serve un controllo a questa scala

Prima di rispondere, serve capire l’ampiezza del problema. Le discrepanze tra gli esiti pre-specificati e quelli riportati sono una fonte importante di bias negli studi clinici. Il progetto COMPare ha corretto e monitorato in tempo reale 58 trial con esiti riportati in modo scorretto, stando a Goldacre et al., 2019. Il numero può sembrare contenuto, ma si tratta di trial seguiti mentre erano in corso o appena pubblicati: un intervento che richiede tempo e competenze.

Il fenomeno, però, è molto più vasto. Secondo i dati di Springer Nature, strumenti di intelligenza artificiale hanno segnalato 25.000 articoli con problemi come manipolazione delle immagini, riferimenti falsi e testi fabbricati. Il controllo manuale su ogni pubblicazione è impensabile. Ma se l’IA può segnalare problemi su larga scala, può anche valutarli con la precisione necessaria?

Il dubbio legittimo

I numeri della valutazione di Kurate offrono una risposta parziale. Su 60 documenti di trial clinici tenuti fuori per il test, le informazioni estratte da Kurate corrispondevano all’etichetta esperta in 221 casi su 242 per i punti del protocollo e in 294 casi su 370 per i punti della pubblicazione dei risultati. In termini di concordanza AC1, un indice che misura l’accordo al netto del caso, si parla di 0,94 per il protocollo e 0,81 per la pubblicazione dei risultati.

Il primo valore è alto. Il secondo è più basso, e cade sul terreno più delicato: la pubblicazione dei risultati, cioè il punto in cui il reporting selettivo può produrre i danni maggiori. Il sistema è molto accurato nel verificare ciò che è stato dichiarato prima, meno nell’esprimere un giudizio su ciò che è stato riportato alla fine. È il paradosso di Kurate: promette di stanare i difetti più insidiosi, ma mostra meno accordo con gli esperti proprio su quei difetti.

Il confronto con il passato è dichiarato: Kurate si misura con gli strumenti automatici nati prima dei modelli linguistici. E c’è un indizio indipendente: come riportato da Scientific Reports, i modelli linguistici potrebbero essere utili nella valutazione del rischio di bias delle revisioni sistematiche. La promessa non è priva di basi. Ma una cosa è l’utilità come supporto, un’altra è l’affidabilità come valutatore autonomo.

Per chi basa decisioni su dati e ricerche pubblicate, Kurate non è ancora un sostituto del controllo umano. È un segnale: l’automazione può affiancare la vigilanza editoriale su larga scala, ma non può sostituire la lettura critica di un esperto. La prossima verifica dovrà avvenire su scala più ampia e con protocolli indipendenti. Fino a quel momento, i numeri di Kurate vanno letti per quello che sono: una base di partenza solida, non un verdetto.

L'autore

Anita Innocenti

Sono una copywriter appassionata di search marketing. Scrivo testi pensati per farsi trovare, ma soprattutto per farsi scegliere. Le parole sono il mio strumento per trasformare ricerche in risultati.

Ricevi i migliori aggiornamenti su SEO

Già +6.200 professionisti iscritti · una mail a settimana, zero spam
✦ Iniziamo

Mercato, richieste e concorrenti. Scopri le potenzialità del tuo business. Dati alla mano.

Qui è dove ha inizio il tuo lancio digitale.