Le regole del digitale stanno cambiando.
O sei visibile o sei fuori. Noi ti aiutiamo a raggiungere i clienti giusti — quando ti stanno cercando.
Contattaci oraBenchmark co-creato con 80 esperti in 22 Paesi, ma resta il divario con la crisi reale
OpenAI ha presentato MentalHealthBench, un benchmark aperto sulla salute mentale creato con 80 esperti autorizzati in 22 Paesi, affiancato da uno studio su 44 adulti di 16 Paesi. Il test misura le risposte dei modelli, ma un punteggio non certifica la sicurezza reale davanti a una crisi, come mostra la valutazione indipendente di Transluce.
Il 23 settembre OpenAI ha presentato MentalHealthBench, un benchmark aperto per la salute mentale co-creato con più di 80 esperti autorizzati in 22 Paesi. Due giorni dopo, la domanda non è se il test sia fatto bene. È se più di un miliardo di persone che usano ChatGPT ogni settimana possa sentirsi al sicuro perché un modello ha superato un test. La distanza tra un punteggio e una crisi reale è tutto il tema di questa storia.
Il test che mancava
MentalHealthBench arriva con una costruzione che OpenAI descrive come rigorosa. Il benchmark include situazioni che coinvolgono adulti, adolescenti, caregiver e clinici, in più lingue e regioni. Ogni conversazione è stata esaminata da almeno tre esperti: sono stati mantenuti solo i criteri concordati da almeno due esperti e non contraddetti da un terzo. È il tentativo di trasformare la valutazione di un tema delicato in qualcosa di misurabile e condiviso, e non è un dettaglio da poco.
Accanto al benchmark, OpenAI cita uno studio separato condotto con 44 adulti che avevano già usato l’IA per supporto mentale o emotivo, in rappresentanza di 16 Paesi e 14 lingue. La base di partenza è ampia, e il fatto che il test sia aperto e non riservato ai laboratori di OpenAI è un passo avanti rispetto alle verifiche che restano chiuse in casa. Resta però la domanda che il benchmark non può sciogliere da solo: quanto vale un test quando la posta in gioco è una crisi reale, magari un’ideazione suicidaria o un episodio psicotico? Perché è lì che ogni valutazione mostra i suoi limiti.
Il paradosso della valutazione
E qui arriva il dubbio: chi controlla chi controlla? OpenAI non è nuova a questo genere di operazioni. A inizio settembre aveva già introdotto HealthBench, un benchmark per misurare le capacità dei sistemi di intelligenza artificiale in ambito sanitario, costruito con 262 medici che hanno esercitato in 60 Paesi e 5.000 conversazioni sanitarie realistiche, ciascuna con una rubrica personalizzata creata da medici per valutare le risposte dei modelli. Il problema è che la salute fisica e la salute mentale in crisi non viaggiano sulla stessa corsia: un modello che risponde bene su un dosaggio può fallire su un utente che dice di voler farla finita.
La differenza l’ha misurata Transluce, che lo scorso 31 agosto ha pubblicato la più ampia valutazione indipendente condotta fino ad oggi su come i principali modelli AI rispondono agli utenti in crisi di salute mentale, inclusi casi di ideazione suicidaria, psicosi e mania. Poche settimane prima di MentalHealthBench, quindi. La parola chiave è indipendente: un conto è un test firmato da chi produce il modello, un altro è una misurazione fatta da fuori. E il confronto dice una cosa scomoda: un’azienda può costruire il benchmark più accurato del mondo e comunque non avere l’ultima parola su ciò che un osservatore esterno vede nel comportamento reale dei modelli.
Anthropic, per parte sua, utilizza già un classificatore interno per suicidio e autolesionismo che indirizza gli utenti a oltre 170 linee di assistenza. Non è una valutazione delle risposte: è una rete di sicurezza operativa. Tre approcci diversi, tre livelli di rassicurazione diversi. Se Anthropic indirizza già gli utenti a oltre 170 linee di assistenza, cosa manca ancora agli altri? La risposta non sta in un singolo test.
Cosa guardare nelle prossime settimane
La risposta potrebbe arrivare presto, ma non da un singolo benchmark. Per chi fa impresa online e costruisce servizi basati su questi modelli, il nuovo standard da osservare è la combinazione di benchmark proprietari e valutazioni indipendenti: i primi raccontano ciò che un’azienda vuole misurare, le seconde ciò che emerge quando a guardare è qualcuno che non ha progettato il modello. Un benchmark non è una certificazione: è un invito a verificare. E la vera domanda non è se il modello risponde bene, ma cosa succede quando l’utente sta male.
