Le regole del digitale stanno cambiando.
O sei visibile o sei fuori. Noi ti aiutiamo a raggiungere i clienti giusti — quando ti stanno cercando.
Contattaci oraIl sistema agisce prima della generazione, ma esiste già RAGTrace che valuta i workflow: la differenza è nella prospettiva
Il 17 settembre 2026 è stato sottomesso ad arXiv FootprintRAG, sistema che rifinisce il contesto di evidenza nella retrieval-augmented generation per ridurre le citazioni inventate, misurate al 55% su GPT-3.5 e al 18% su GPT-4. Conta perché attacca un limite strutturale della RAG, ma resta un annuncio: la prova sarà l'adozione reale su GitHub e il confronto con RAGTrace.
Il 55% delle citazioni generate da GPT-3.5 non esiste. Non è un refuso: è la misura pubblicata da uno studio su Nature Scientific Reports. Ieri, 17 settembre 2026, la sottomissione ad arXiv di FootprintRAG ha presentato un sistema che promette di eliminare questo rischio per chi usa la retrieval-augmented generation.
Per capire la posta in gioco serve un passo indietro. La retrieval-augmented generation, abbreviata in RAG, è la tecnica che fa recuperare a un modello i documenti prima di generare una risposta, invece di lasciarlo rispondere a memoria. Sulla carta riduce gli errori. Nella pratica ha un problema strutturale: la provenienza delle informazioni. Ed è qui che FootprintRAG prova a intervenire.
Un sistema che rifinisce il contesto prima di rispondere
Il paper di FootprintRAG, firmato da Xingyu Liu, Yu Dong, Qizhen Yu, Shiyu Cheng, Zhe Wang, Guan Li, Guihua Shan, Dong Tian, Christy Jie Liang e Quang Vinh Nguyen, descrive un sistema di analisi visuale basato su agenti LLM — modelli linguistici che lavorano per passaggi successivi — per il raffinamento del contesto di evidenza nell’esplorazione della letteratura scientifica. Tradotto: invece di accettare il contesto recuperato così com’è, FootprintRAG lo rifinisce prima che il modello generi la risposta. Il lavoro è stato valutato con due casi di studio, uno studio con utenti e un confronto a livello di workflow con sistemi RAG rappresentativi. Il codice è disponibile pubblicamente su GitHub. Il paper è classificato sotto i soggetti Graphics, Human-Computer Interaction e Information Retrieval: un dettaglio che segnala l’ambizione di parlare sia ai tecnici sia a chi progetta le interfacce.
A questo punto la domanda è semplice: perché serve un sistema del genere? La risposta sta nei limiti strutturali della RAG.
Il tallone d’Achille della RAG
Il punto di partenza è già nel 2020, con il paper di Lewis et al. presentato a NeurIPS che ha introdotto la generazione aumentata dal recupero. Già in quel testo si ammetteva che fornire la provenienza delle decisioni dei modelli e aggiornare la loro conoscenza del mondo restavano problemi di ricerca aperti. Non erano dettagli minori: sono esattamente i due punti da cui nascono le citazioni inventate.
I numeri lo confermano. Lo studio pubblicato su Nature Scientific Reports citato in apertura ha misurato che il 55% delle citazioni generate da GPT-3.5 è fabbricato. Con GPT-4 la percentuale scende al 18%: un miglioramento, certo, ma comunque quasi una citazione su cinque che rimanda a un lavoro inesistente. Per chi pubblica contenuti o fa ricerca, è la differenza tra una fonte verificabile e un link che non porta da nessuna parte.
E il problema non è solo di accuratezza. Lo conferma un’indagine del 2025 sulla RAG affidabile, firmata da più istituzioni tra cui Meta, Adobe e Oracle: la RAG introduce rischi di responsabilità e spiegabilità che incidono direttamente sull’affidabilità. Che tra i firmatari ci siano anche aziende che vendono strumenti di AI non è un dettaglio neutro. Ma il rischio descritto è reale e misurabile, ed è lo stesso che FootprintRAG dice di voler ridurre.
La promessa di FootprintRAG si misura esattamente contro questi numeri. Ma un sistema per valutare i workflow RAG esiste già: RAGTrace. FootprintRAG è abbastanza diverso da imporsi?
Cosa guardare nelle prossime settimane
Per capirlo serve guardare al panorama competitivo. Nel 2025 l’ACM ha pubblicato RAGTrace, un sistema di valutazione interattivo progettato per analizzare le dinamiche di recupero e generazione nei workflow basati su RAG. La differenza con FootprintRAG è di prospettiva: RAGTrace osserva e valuta, FootprintRAG rifinisce il contesto prima della risposta. Non sono lo stesso prodotto, ma si muovono nello stesso territorio.
Il verdetto arriverà da GitHub e dal confronto con RAGTrace. Un paper su arXiv, per quanto promettente, resta un annuncio: la prova è nell’adozione reale, nella manutenzione del codice e nella capacità di integrare i feedback degli utenti.
Per chi fa impresa online, la differenza è tra citare fonti vere e perdere credibilità con link inventati. Il banco di prova sarà l’adozione reale su GitHub e il confronto con RAGTrace.
