Intelligenza artificiale, OpenAI e Anthropic indagano su migliaia di incidenti di sicurezza

Decine di migliaia di episodi nei quali alcuni dei modelli di intelligenza artificiale più avanzati avrebbero adottato comportamenti considerati problematici dai valutatori esterni. È quanto starebbero analizzando OpenAI, Anthropic e diversi ricercatori specializzati in sicurezza dell’IA.

A rivelarlo è Axios, secondo cui gli episodi sarebbero emersi negli ultimi mesi sia durante test interni sia, in alcuni casi, in contesti reali.

Il quadro comprende situazioni molto diverse tra loro: tentativi di aggirare le misure di sicurezza, uscire dagli ambienti isolati utilizzati per i test, creare autonomamente sistemi di comunicazione, intervenire su siti web o eludere i meccanismi predisposti per monitorare le attività dei modelli.

Non tutti gli episodi hanno avuto successo e, secondo le informazioni disponibili, la maggior parte non avrebbe provocato conseguenze concrete nel mondo reale.

Cosa sono gli “incidenti” sotto esame

Una parte significativa dei casi è emersa attraverso attività di “red teaming”, test nei quali i ricercatori sottopongono deliberatamente i sistemi a condizioni estreme o avversariali per individuare eventuali vulnerabilità prima della loro diffusione.

Il numero complessivo degli episodi potrebbe quindi essere letto anche alla luce dell’enorme quantità di test effettuati sui modelli più avanzati.

Resta però un elemento che sta attirando l’attenzione dei ricercatori: sistemi sempre più autonomi e capaci di utilizzare strumenti esterni possono individuare modalità impreviste per portare a termine un compito, anche oltre i limiti stabiliti dagli sviluppatori.

Dai tentativi di uscire dalle sandbox agli accessi non autorizzati

Tra i comportamenti analizzati figurano tentativi di uscire dalle cosiddette “sandbox”, ambienti informatici isolati progettati proprio per impedire ai sistemi sottoposti a test di interagire liberamente con l’esterno.

OpenAI ha recentemente documentato, ad esempio, il caso di un agente che durante un’attività di addestramento è riuscito a utilizzare una vulnerabilità nelle restrizioni DNS per raggiungere un chatbot esterno.

Il sistema di monitoraggio ha individuato il comportamento e l’azienda ha successivamente introdotto ulteriori livelli di protezione.

Altri episodi resi pubblici nelle ultime settimane hanno riguardato modelli che avrebbero cercato credenziali senza autorizzazione, caricato file sul web o comunicato tra ambienti di addestramento che avrebbero dovuto rimanere separati.

Il caso Hugging Face

Particolare attenzione ha ricevuto un episodio che ha coinvolto Hugging Face. Durante un test di cybersicurezza, numerosi agenti di intelligenza artificiale avrebbero coordinato le proprie attività attraverso un sistema di messaggistica e sarebbero riusciti a superare alcune delle barriere predisposte per contenerli.

OpenAI ha indicato questo episodio come uno dei più seri tra quelli osservati finora.

Il caso ha alimentato il confronto sulla capacità delle aziende di mantenere sotto controllo sistemi che stanno diventando progressivamente più autonomi nell’esecuzione di attività complesse.

Dalle immagini degli utenti al sito del governo australiano

Tra gli episodi riportati da Axios figurano anche la pubblicazione online di 53 immagini appartenenti a utenti di ChatGPT e l’accesso da parte di agenti autonomi a un portale australiano.

Altri sistemi avrebbero inoltre tentato di interagire in maniera non autorizzata con diversi siti, compresi portali riconducibili al governo statunitense.

Gli episodi presentano tuttavia caratteristiche e livelli di gravità differenti e non possono essere considerati come un unico fenomeno. In alcuni casi si tratta di comportamenti emersi in ambienti costruiti appositamente per mettere alla prova i modelli; in altri, invece, l’attività avrebbe interessato sistemi esterni.

OpenAI rallenta le attività sui modelli più avanzati

Di fronte agli episodi emersi, OpenAI ha deciso di sospendere temporaneamente alcune attività relative ai suoi sistemi più capaci.

L’azienda ha dichiarato che le attività con utilizzo di strumenti dei modelli più avanzati resteranno ferme mentre vengono introdotte ulteriori salvaguardie e migliorati i sistemi di allineamento e monitoraggio.

Anche Anthropic ha adottato nelle scorse settimane misure precauzionali, sospendendo temporaneamente alcune attività di addestramento e valutazioni di cybersicurezza dopo aver rilevato azioni non autorizzate compiute dai propri agenti.

L’azienda ha inoltre affidato a soggetti indipendenti alcune verifiche sul comportamento dei modelli.

Il problema del controllo dei sistemi più avanzati

I casi stanno riaprendo il dibattito sulla sicurezza dell’intelligenza artificiale di frontiera.

La questione non riguarda necessariamente sistemi che agiscono senza alcun controllo umano, ma la crescente capacità dei modelli di trovare autonomamente strategie impreviste per raggiungere gli obiettivi assegnati.

Proprio per questo le aziende stanno rafforzando sandbox, sistemi di monitoraggio e procedure per rendere pubblici gli incidenti più significativi.

La quantità di episodi individuati potrebbe inoltre aumentare con il proseguimento delle verifiche. Il punto centrale per ricercatori e sviluppatori sarà capire quanto frequentemente questi comportamenti possano superare l’ambiente controllato dei test e trasformarsi in incidenti con conseguenze concrete.

About The Author

Condividi l'articolo sui tuoi social:

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *