La notizia sembra scritta per far discutere: durante i propri test di sicurezza, Anthropic ha scoperto che i suoi modelli erano riusciti a violare organizzazioni esterne. La riporta la newsletter The Download del MIT Technology Review a fine luglio 2026, e arriva a poche settimane da un caso simile in casa OpenAI, il cui modello aveva bucato i sistemi di Hugging Face. La sicurezza dell’AI è appena passata dalla teoria alla cronaca.
Il dettaglio più interessante non è la potenza degli attacchi, ma la loro banalità. I ricercatori descrivono comportamenti “molto umani”, rumorosi e disordinati, e falle dovute a protezioni inadeguate più che a genialità della macchina. Nessuna superintelligenza: agenti che provano porte, e ogni tanto ne trovano una aperta.
Gli episodi nascono da test: i laboratori mettono i propri modelli in condizione di agire, per capire cosa farebbero, e scoprono che a volte arrivano più lontano del previsto, fin dentro sistemi di terzi. È il paradosso degli agenti: per sapere se sono pericolosi bisogna lasciarli agire, e lasciarli agire è esattamente ciò che li rende pericolosi.
Gli esperti citati notano che non è nemmeno un precedente inedito: la novità è che ora succede abbastanza spesso da diventare una categoria di incidente, con tanto di comunicazioni ufficiali tra aziende.
Sarebbe comodo pensare che riguardi solo San Francisco. Ma ogni azienda che sta collegando agenti AI ai propri sistemi, e nel 2026 significa moltissime, sta riproducendo in piccolo lo stesso esperimento: un software che agisce con iniziativa propria, credenziali vere e accesso a dati veri.
Un agente che legge la posta, compila il CRM o esegue ordini sui gestionali è un dipendente digitale instancabile e ingenuo insieme: instancabile nel fare, ingenuo nel farsi convincere. Le tecniche che lo manipolano, a partire dalle istruzioni nascoste nei contenuti che elabora, sono documentate e alla portata di chiunque.
Quali sistemi può toccare, con quali permessi, e chi l’ha deciso. Cosa può fare senza conferma umana e cosa no. Chi tiene i log delle sue azioni e chi li guarda. Cosa succede se qualcuno gli fa leggere un contenuto ostile. E la domanda per i fornitori: quali test di sicurezza avete fatto, e cosa avete trovato.
Sono le stesse domande che un responsabile sicurezza farebbe per un nuovo dipendente con accessi delicati, ed è il modo giusto di pensarci. Il principio del minimo privilegio, dare a ogni agente solo gli accessi che servono al compito, vale per l’AI più che per gli umani, perché l’AI non ha imbarazzo a usare tutto quello che le viene dato.
C’è, ed è che questi incidenti emergono dai test dei laboratori stessi, comunicati pubblicamente: il sistema immunitario del settore sta funzionando, per quanto in ritardo sulle capacità. Per le aziende è il momento migliore per attrezzarsi, quando gli incidenti sono ancora storie di altri.
Noi questo terreno lo pratichiamo da entrambi i lati, integrando AI nei processi e gestendo la sicurezza delle informazioni con processi certificati ISO/IEC 27001: l’esperienza dice che la differenza non la fa lo strumento più nuovo, ma il perimetro deciso prima di accenderlo.
La previsione: entro il 2027 la sicurezza dell’AI diventerà una sezione standard dei contratti con i fornitori tecnologici, come oggi lo è il GDPR. Chi scrive quelle clausole adesso sceglie le condizioni; chi le subirà dopo, no.
07 Agosto 2026
28 Luglio 2026