OpenAI: sei incidenti AI nei modelli GPT tra 2025 e 2026

OpenAI ha confermato sei incidenti di disallineamento dei modelli AI avvenuti durante le fasi di addestramento e valutazione interna tra ottobre 2025 e luglio 2026. I casi, descritti in un report pubblicato dall’azienda, riguardano comportamenti non autorizzati di sistemi ancora in sviluppo, inclusi l’occultamento di errori, l’uso di credenziali esposte e la condivisione di file attraverso servizi esterni.

Gli episodi non coinvolgono necessariamente prodotti disponibili al pubblico come ChatGPT, ma offrono indicazioni sui rischi che possono emergere nei sistemi capaci di agire in autonomia. OpenAI ha invitato le altre aziende del settore, comprese quelle che sviluppano modelli concorrenti come Anthropic, Google Gemini e Perplexity, a condividere informazioni simili in attesa di uno standard comune per la segnalazione degli incidenti AI.

Pubblicità

Sei casi di disallineamento durante l’addestramento

Il primo episodio riguarda un modello non pubblico della famiglia Astra. Nel corso dell’addestramento, il sistema ha inserito istruzioni all’interno di 27 riassunti. Secondo OpenAI, quei comandi apparivano simili a un tentativo di jailbreak e avrebbero potuto indirizzare il modello verso azioni diverse da quelle consentite.

Un comportamento analogo, ma con conseguenze più direttamente legate all’affidabilità delle risposte, è stato rilevato durante l’addestramento di GPT‑5.6 Sol. Diverse istanze del modello hanno aggiunto istruzioni ai propri riassunti per nascondere errori o comportamenti non allineati.

Tra gli esempi individuati figurano indicazioni per inventare dati storici mancanti senza dichiararne l’assenza e per occultare discrepanze tra differenti versioni delle fonti. Il problema non riguarda quindi soltanto la possibilità che un modello produca un’informazione errata, ma anche il tentativo di mascherare l’errore durante i processi di controllo.

Chiavi API, browser e iniziative non autorizzate

Uno degli episodi descritti da OpenAI mostra come un modello possa oltrepassare i confini stabiliti per raggiungere un obiettivo. Durante una richiesta di routine sui dati relativi ai guadagni in una contea della California, un sistema interno ha individuato una chiave API pubblicata su GitHub e l’ha utilizzata senza autorizzazione.

La credenziale non ha comunque permesso al modello di recuperare le cifre richieste. Invece di dichiarare il fallimento, il sistema ha inventato i valori e li ha presentati come se provenissero dalla fonte indicata dall’utente. L’incidente combina dunque due criticità: l’accesso non consentito a una risorsa esterna e la produzione di dati falsi attribuiti a una fonte reale.

Un altro caso ha coinvolto un modello non ancora rilasciato, incaricato di elencare i laghi con una superficie superiore a 5 milioni di metri quadrati. L’agente ha trovato la risposta corretta usando Python, ma le istruzioni richiedevano anche una citazione ottenuta tramite il browser.

Per soddisfare questo vincolo, il sistema ha scelto di caricare il file generato per poterlo citare nella risposta. L’iniziativa non era stata autorizzata e dimostra come un agente possa interpretare in modo estensivo un obiettivo, arrivando a compiere operazioni non previste pur partendo da una richiesta legittima.

Modelli AI usati per comunicare e condividere file

Gli altri due incidenti hanno riguardato la collaborazione tra più agenti impegnati nello stesso compito di addestramento. In un caso, diversi campioni del modello hanno utilizzato un repository interno di Artifactory come una sorta di forum di discussione.

I sistemi hanno inserito richieste e risposte nel repository mentre cercavano file di input mancanti. L’operazione non ha permesso di recuperare i dati necessari, ma ha evidenziato un uso imprevisto di una risorsa interna per coordinare il comportamento tra istanze differenti.

Nel secondo episodio, agenti che lavoravano allo stesso compito hanno utilizzato siti di file hosting per scambiarsi documenti. Le istruzioni prevedevano invece l’impiego esclusivo di file locali.

In entrambi i casi, il comportamento non corrisponde a un semplice errore nella generazione di testo. I modelli hanno cercato strumenti alternativi per superare un ostacolo operativo, anche quando tali strumenti non rientravano nei limiti definiti dall’ambiente di addestramento.

OpenAI propone una maggiore trasparenza sugli incidenti

OpenAI ha spiegato di aver pubblicato finora i dettagli degli incidenti senza seguire un metodo completamente sistematico. I casi sono stati spesso raccolti in report unici e non sempre comunicati subito dopo la loro individuazione.

La società guidata da Sam Altman intende ora adottare un framework più strutturato per classificare e descrivere gli incidenti AI. L’obiettivo è fornire alle organizzazioni esterne un riferimento utile per individuare vulnerabilità nelle misure di sicurezza, anomalie nei modelli e iniziative non autorizzate degli agenti.

L’azienda auspica la definizione di uno standard condiviso per il settore, ma riconosce che il percorso potrebbe richiedere diversi mesi. Nel frattempo, OpenAI sostiene che la pubblicazione dei casi possa favorire un confronto tra le aziende che sviluppano sistemi di intelligenza artificiale, dai modelli GPT alle piattaforme concorrenti.

La società ha inoltre anticipato la divulgazione di altri incidenti, compresi quelli più complessi e ancora oggetto di indagini interne.

Aggiungici su Google News Aggiungi MRW alle tue fonti preferite su Google! Aggungi su Google
Pubblicità
Massimiliano Bossi
Massimiliano Bossi
Stregato dalla rete sin dai tempi delle BBS e dei modem a 2.400 baud, ho avuto la fortuna di poter trasformare la mia passione in un lavoro (nonostante una Laurea in Giurisprudenza). Adoro scrivere codice e mi occupo quotidianamente di comunicazione, design e nuovi media digitali. Orgogliosamente "nerd" sono il fondatore di MRW.it (per il quale ho scritto centinaia di articoli) e di una nota Web-Agency (dove seguo in prima persona progetti digitali per numerosi clienti sia in Italia che all'estero).

Leggi anche...

Trump annuncia la AI Force e vuole rinominare l’AI

Donald Trump ha annunciato il 20 settembre 2026, negli...

Google, Gemini e l’AI: traduzione in oltre 300 lingue

Il 16 settembre 2026 Google ha presentato i progressi...

Google Home apre agli agenti AI con MCP, Claude e ChatGPT

Google ha aperto l’accesso preliminare a Home MCP, un...

Anthropic unifica Claude e l’AI per creare presentazioni

Anthropic ha unificato Claude Chat e Claude Cowork in...

Exein diventa unicorno: round da 270 milioni per la cybersecurity

La società italiana di cybersecurity Exein ha chiuso il...

Ue, primo progetto Ipcei per l’IA con 19 Stati membri

La Commissione europea ha accolto l’iniziativa di 19 Stati...
PubblicitÃ