Il sistema usa un linguaggio di query booleano per ispezionare i risultati prima di scaricare solo le parti necessarie
Meno pagine visitate, più risposte corrette. Sembra un paradosso, ma è esattamente ciò che promette Sieve, un nuovo agente di ricerca descritto in un paper pubblicato su arXiv il 3 agosto 2026. I numeri fanno riflettere: sui test di domanda-risposta, Sieve consuma dal 20,7% al 50,6% di token in meno rispetto ai sistemi tradizionali, eppure risulta più accurato. Per chiunque pubblichi contenuti online, è un segnale da non ignorare.
Il setaccio booleano
Sieve non aggiunge complessità fine a sé stessa: introduce un passaggio intermedio di ispezione guidato da un linguaggio di query booleano, il Boolean Query Language (BQL). Mentre un agente di ricerca convenzionale cerca una pagina, la visita per intero e ne ingerisce il contenuto, Sieve adotta una strategia “search–inspect–fetch”: prima cerca, poi ispeziona i risultati con query booleane chirurgiche, e solo a quel punto decide quali parti prelevare. È un po’ come se, invece di leggere un libro intero per trovare una citazione, si sfogliasse l’indice analitico e si andasse dritti alla pagina giusta.
Il dato più interessante del paper è che il filtraggio booleano non aiuta solo un tipo di modello: migliora ogni ranker testato. In altre parole, non importa quale sistema di ordinamento dei risultati si utilizzi; aggiungere lo strato booleano di Sieve ne aumenta comunque le prestazioni. L’implementazione è già disponibile per chi vuole verificare: il codice è stato incluso nella libreria open source SkimSearchAgent su GitHub, curata dal gruppo ielab, dove convive con strategie più tradizionali come Search-Visit, Search-Fetch, recupero lessicale e denso, e interazione diretta con il corpus.
Il punto non è solo tecnico. L’approccio di Sieve dimostra che non serve ingurgitare tutto il testo di una pagina per azzeccare la risposta giusta. Anzi: meno token si consumano, meno rumore si introduce, meno distorsioni affliggono il modello. Per chi fa impresa e investe in visibilità sui motori di ricerca, significa che la quantità di parole scritte conta sempre meno; comincia a contare la capacità di rendere le informazioni estraibili in modo selettivo.
Da OpenAI a Sieve: due filosofie a confronto
L’anno scorso OpenAI lanciava un agente ChatGPT per la ricerca approfondita, basato su una versione del modello o3 ottimizzata per la navigazione web e l’analisi dei dati. Secondo quanto riferito da OpenAI, quell’agente è pensato per cercare e visitare intere pagine web, ingerendo grandi quantità di testo nel contesto. È l’esatto opposto di ciò che propone Sieve: da una parte un approccio onnivoro, che raccoglie tutto e poi cerca di distillare una risposta; dall’altra un’ispezione chirurgica, che taglia il superfluo ancora prima di leggere.
Questa differenza non è solo accademica. In uno scenario in cui gli agenti diventano più selettivi, chi pubblica contenuti online deve chiedersi: il mio sito è pronto a rispondere a una query booleana? Le informazioni chiave sono isolate e semanticamente nette, oppure affogate in paragrafi prolissi che un Sieve qualsiasi potrebbe semplicemente scartare? Non si tratta di scrivere meno, ma di strutturare meglio. Se l’agente decide cosa prelevare in base a un filtro booleano, la densità informativa e l’organizzazione dei contenuti diventano decisive.
Il paper di Sieve, uscito la scorsa settimana, non è ancora un prodotto commerciale, ma è un chiaro indicatore di direzione. La strategia search–inspect–fetch non è un esercizio teorico: funziona su tre collezioni di domande e risposte, e migliora le configurazioni esistenti. È plausibile che i motori di ricerca e gli assistenti AI inizieranno a integrare logiche simili, semplicemente perché consumare meno token significa ridurre i costi di inferenza senza perdere qualità. Per chi vive di traffico organico, il messaggio è netto: smettere di rincorrere il volume e iniziare a presidiare la pertinenza.
Prepariamoci a un mondo in cui la ricerca agentiva premia la rilevanza strutturata, non il volume. Sieve non è né una rivoluzione né una minaccia: è un campanello d’allarme. Il futuro della visibilità potrebbe dipendere da come i nostri contenuti rispondono a una query booleana, non da quante parole riempiono una pagina. E chi oggi ignora questa tensione, domani potrebbe scoprire che i propri testi esistono, ma nessun agente li legge più.
