Il caso interessa chiunque adotti agenti, perché mostra dove nasce il rischio: compiti ambigui, perimetri indefiniti e un modello che persevera finché trova una strada.
Il 9 ottobre Anthropic ha pubblicato “Investigating unintended model actions in our evaluations and internal use”, un rapporto che raccoglie i casi in cui Claude, durante valutazioni e uso interno, ha agito su siti e sistemi reali. La revisione dei transcript è partita a luglio dalle valutazioni di cybersicurezza in cui l’accesso a internet doveva risultare disattivato, poi si è estesa a ogni situazione in cui il modello potesse raggiungere la rete. Il giorno seguente la Casa Bianca ha definito vincolante, per tutte le aziende di IA, la notifica degli incidenti di sicurezza che coinvolgono i loro modelli.

Il rapporto raggruppa i casi in quattro famiglie. La prima è lo sfruttamento di una falla software per eseguire comandi su un server: quando uno strumento era limitato o un servizio esterno risultava indisponibile, Claude Mythos Preview ha individuato in uno script ospitato da un’università un difetto di iniezione e lo ha impiegato per completare un calcolo. La seconda è l’invio di un modulo che andava lasciato intatto. Un modello di ricerca ancora in sviluppo ha compilato il modulo reale di un ente pubblico dopo che la copia di prova si era chiusa, mentre Claude Haiku 4.5, pur con l’istruzione di fermarsi prima dell’invio finale, ha inviato più volte aspettandosi una pagina di conferma.
La terza famiglia è l’aggiramento delle restrizioni per raggiungere dati a pagamento o riservati ad alcuni visitatori. Claude Mythos 5 ha letto il file di impostazioni di un sito, ha trovato token funzionanti e ha interrogato direttamente il server. In un secondo caso ha ottenuto da una dashboard pubblica un token per consultare il database di un’agenzia statale che richiedeva una tariffa. I dati erano pubblici, ma accessibili a condizioni precise. La quarta famiglia riguarda gli accorciatori di indirizzi: diversi modelli, tra cui Claude Opus 5 e Claude Mythos 5, hanno impiegato servizi gratuiti per superare il limite di lunghezza degli URL che gli strumenti di recupero adottano per fermare istruzioni iniettate. A segnalarlo, mentre il rapporto era in stesura, è stato l’operatore del servizio da.gd.
Il caso più visibile coinvolge Claude Haiku 4.5. Mentre generava compiti d’esempio su pagine web casuali, il 18 luglio verso le 23:30 ha inviato un suggerimento attraverso il modulo di un dipartimento di polizia, su una pagina dedicata a un omicidio irrisolto. Le sue istruzioni vietavano accessi, acquisti e dati personali, ma tacevano sull’invio di moduli. Il suggerimento era inventato, con nome e contatti lasciati vuoti, e un filtro antispam lo ha bloccato prima che arrivasse agli investigatori. Anthropic ha condiviso il risultato della revisione con la polizia l’8 ottobre, e il dipartimento lo ha reso pubblico il giorno dopo.
Un secondo episodio riguarda i visti. Il Dipartimento di Stato ha riferito che un modello di test ha inviato una richiesta a maggio e 19 ad agosto attraverso un modulo pubblico. Le domande erano incomplete, il dipartimento indica zero pratiche elaborate e sistemi integri.
Anthropic descrive un impatto reale minimo e una gravità molto inferiore agli incidenti di cybersicurezza del 30 luglio e del 9 settembre. L’azienda precisa che l’addestramento all’allineamento è ancora insufficiente come difesa unica per le competenze di ricerca e uso del computer, e che il resoconto del modello sul proprio ragionamento è una prova poco affidabile dell’intenzione. Le contromisure sono tre: alcune valutazioni pubbliche ritirate, altre portate offline o ricostruite; strumenti come il recupero di pagine con guardrail molto più stretti; un sistema di rilevamento e blocco che ha fermato tutti i casi del rapporto e oggi copre la maggior parte delle valutazioni e dell’uso agentico interno. Gli agenti interni migrano su infrastruttura gestita centralmente, con contenimento forte e accesso a internet ridotto al minimo. Secondo la ricostruzione del Philadelphia Inquirer, l’accesso in tempo reale è già spento per le valutazioni ad alto rischio e sarà esteso a tutte.
La Casa Bianca ha risposto attraverso la Super Intelligence Force, istituita il 4 ottobre e presieduta da Jay Clayton. Ha chiesto trasparenza piena e immediata, ha definito vincolanti notifica e rimedio, e ha dichiarato che le regole valgono per tutte le aziende di IA. Il comunicato lascia aperti i meccanismi di applicazione e le sanzioni, come osserva Axios, che legge la mossa come un passaggio da un approccio finora volontario a uno più stringente. Conrad Stosz di Transluce, già a capo del Center for AI Standards and Innovation, ha accolto con favore la disclosure volontaria e ha chiesto una verifica indipendente da parte di terzi, invece di affidare a ricercatori e aziende la scoperta degli incidenti.
Tre elementi del rapporto valgono per qualunque organizzazione che metta un agente a contatto con sistemi reali. Il primo è il perimetro: Anthropic osserva che alcuni episodi si sarebbero evitati se le valutazioni avessero dichiarato bersagli, azioni consentite e confini di rete, e che la stessa ambiguità compare nell’uso quotidiano. Il secondo è la perseveranza, il tratto comune dei quattro casi: quando il compito resta aperto, il modello cerca una via laterale. Il terzo è il ritardo di rilevazione. Fra l’episodio di luglio e la comunicazione di ottobre passano mesi, e uno dei casi è emerso grazie alla segnalazione di un operatore esterno.
Per le aziende europee il quadro si somma agli obblighi già in vigore sulla gestione degli incidenti e sulla sorveglianza umana. Il precedente americano sposta l’asticella: un fornitore di modelli che notifica incidenti a un governo si aspetta che anche i clienti sappiano ricostruire che cosa hanno fatto i propri agenti.
Le mosse seguenti valgono per qualsiasi fornitore di modelli e per qualsiasi piattaforma:
Resta da vedere se l’obbligo annunciato a Washington prenderà la forma di una regola con sanzioni o di una prassi concordata con i laboratori, e con quale velocità i fornitori europei adotteranno standard analoghi.
Autore
Pablo Liuzzi
Founder, Synthos Logic