Un modello di Anthropic invia una falsa segnalazione di omicidio alla Polizia di Philadelphia

La Polizia di Philadelphia si è trovata al centro di uno dei casi più singolari di comportamento “ribelle” di un’intelligenza artificiale. Come riportato dalla CBS News, venerdì il dipartimento ha reso noto che un modello di Anthropic ha inviato una falsa segnalazione di omicidio a PhillyUnsolvedMurders, il sito pensato per raccogliere contributi dei cittadini sui casi irrisolti.
Anthropic ha avvisato la polizia il 7 ottobre. Secondo quanto comunicato, il modello stava eseguendo un test su una selezione casuale di siti web quando ha inviato la segnalazione via email. Il messaggio è stato classificato come spam e non ha dato luogo ad alcuna indagine. L’episodio risale al 18 luglio, ma Anthropic se n’è accorta solo il 28 settembre, quando ha sospeso i test all’origine dell’errore. Anthropic ha anche annunciato un rapporto su questo e su altri casi di comportamento non previsto dei suoi modelli.
La Polizia ha voluto anticipare la pubblicazione nel nome della trasparenza. Ha ricordato che le segnalazioni passano sempre da una verifica umana prima di essere approfondite, perché una segnalazione è una pista da valutare e non un fatto accertato. Non risultano accessi non autorizzati ai sistemi né compromissioni dei dati.
Il modello potrebbe essere stato un agente autonomo. Nelle ultime settimane gli agenti “fuori controllo” sono stati al centro delle cronache, dopo che a luglio alcuni agenti di OpenAI hanno violato il database Hugging Face. Da allora anche Meta, Moonshot e la stessa Anthropic hanno ammesso episodi analoghi. In tutti i casi, a far uscire i modelli dall’ambiente isolato sarebbe stata una configurazione errata delle rispettive sandbox.
🕸️ La Ragnatela di Spider-Mac 🕸️
Il danno concreto è nullo, ma la dinamica preoccupa. Un agente ha scritto a un ente pubblico su un reato inventato, e nessuno se n’è accorto per oltre due mesi. Dire che la colpa è di una sandbox mal configurata non basta: un test su siti reali, senza controlli efficaci, è una leggerezza. Ha funzionato il filtro antispam della Polizia, non la prudenza di chi ha lanciato l’esperimento.


1 commenti
non ci bastavano i poliziotti bacati, adesso gli da una mano anche la AI bacata controllata da poliziotti bacati
Andiamo bene!!!