Anthropic, l’allarme di 3 ex dipendenti: l’AI può sterminare l’umanità entro il decennio

Tre ex ricercatori di Anthropic, l’azienda che ha sviluppato il chatbot Claude, hanno lanciato su X un allarme sui possibili rischi legati allo sviluppo dell’intelligenza artificiale dopo aver lasciato la società. Secondo le loro dichiarazioni, tra alcuni ricercatori e dirigenti del settore sarebbe concreta la preoccupazione che sistemi di AI molto più avanzati di quelli attuali possano arrivare a rappresentare un rischio esistenziale per l’umanità già entro il prossimo decennio.

Le affermazioni assumono particolare rilievo perché provengono da persone che hanno lavorato direttamente allo sviluppo e alla sicurezza dei sistemi di intelligenza artificiale.

Pubblicità

La denuncia di Jacob Coxon sui rischi dell’AI

Jacob Coxon, uno dei ricercatori che hanno lasciato Anthropic, ha sostenuto che la preoccupazione degli addetti ai lavori non sarebbe una semplice strategia comunicativa o una forma di marketing. Al contrario, secondo Coxon, timori molto seri verrebbero espressi privatamente anche da persone con ruoli tecnici e manageriali di primo piano.

«Le persone che sviluppano l’AI credono sinceramente che potrebbe ucciderci tutti entro la fine del decennio. Non si tratta di una trovata di marketing. Anzi, molti dirigenti e ricercatori di alto livello cercheranno di usare un linguaggio più pacato con la stampa, ma sento le stesse persone esprimere privatamente questa paura. Nessun’altra attività umana rappresenta un pericolo di questo livello».

Il riferimento è alla rapida crescita delle capacità dei modelli di intelligenza artificiale, oggi utilizzati non soltanto per generare testi, immagini e codice, ma anche per eseguire sequenze di azioni e interagire con strumenti e servizi esterni.

Tweet di Jacob Coxon in cui dichiara di essersi dimesso da Anthropic a causa delle preoccupazioni relative al comportamento irresponsabile delle aziende che operano nel settore dell’intelligenza artificiale, avvertendo che i progressi incontrollati in questo campo potrebbero persino comportare il rischio di “sterminare l’umanità”.

Il passaggio da un chatbot che risponde alle richieste dell’utente a un agente capace di pianificare ed eseguire autonomamente una serie di operazioni introduce infatti nuove problematiche di sicurezza.

Alle parole di Coxon ha risposto Evan Hubinger, responsabile scientifico dell’allineamento ad Anthropic. Con il termine “allineamento” si indica, in questo contesto, l’insieme delle tecniche e delle strategie utilizzate per fare in modo che gli obiettivi e i comportamenti di un sistema di intelligenza artificiale rimangano compatibili con le intenzioni e gli interessi umani.

«Jacob ha ragione – crediamo davvero che l’AI potrebbe sterminare tutta l’umanità! Personalmente, penso che la percentuale supererà il 10% entro il prossimo decennio. Credo che Anthropic stia facendo del suo meglio, ma non abbiamo ancora un piano per risolvere il problema dell’allineamento per la superintelligenza e non siamo chiaramente sulla buona strada per farlo».

La percentuale indicata da Hubinger rappresenta naturalmente una sua valutazione personale e non una previsione scientificamente accertata. La dichiarazione evidenzia però quanto il cosiddetto problema dell’allineamento sia considerato importante da una parte della comunità che lavora sui sistemi di AI più avanzati.

Un sistema potrebbe infatti interpretare un obiettivo in maniera diversa da quanto previsto dai suoi sviluppatori oppure individuare strategie inattese per raggiungerlo. Il problema diventa più complesso quando un modello può operare attraverso numerosi passaggi, utilizzare strumenti digitali, interagire con sistemi esterni e adattare la propria strategia sulla base dei risultati ottenuti.

Sulla stessa linea si è espresso Samuel Marks, responsabile della supervisione scalabile di Anthropic. Secondo la sua valutazione, una parte degli sviluppatori considera possibile che sistemi di AI futuri possano provocare conseguenze estremamente gravi, fino a scenari di rischio esistenziale. Marks ha inoltre osservato che, nella sua esperienza, il livello di preoccupazione tenderebbe ad aumentare tra le persone con maggiore esperienza all’interno del settore.

L’esempio del “massimizzatore di graffette”

Un esempio celebre utilizzato per spiegare il problema dell’allineamento è quello del “massimizzatore di graffette” (paperclip maximizer), esperimento mentale reso famoso dal filosofo Nick Bostrom.

Immaginiamo di affidare a un’AI estremamente avanzata un obiettivo apparentemente innocuo: produrre il maggior numero possibile di graffette. Un essere umano darebbe per scontati alcuni limiti: non danneggiare le persone, non consumare risorse indispensabili e fermarsi quando produrre altre graffette non ha più senso. Ma se questi limiti non facessero parte dell’obiettivo, una macchina sufficientemente potente potrebbe teoricamente cercare sempre più energia e materie prime, costruire nuove fabbriche e persino tentare di impedire agli esseri umani di spegnerla, perché essere disattivata le impedirebbe di continuare a perseguire il proprio scopo.

L’esempio è volutamente estremo: il punto non è immaginare un’AI “cattiva” o desiderosa di danneggiare l’umanità, ma mostrare come un sistema molto potente possa produrre conseguenze catastrofiche semplicemente perseguendo con estrema efficacia un obiettivo mal definito.

Perché fermare l’intelligenza artificiale è così difficile

Gli allarmi sui possibili rischi dell’AI si susseguono da quando strumenti come ChatGPT hanno portato i modelli generativi al grande pubblico. Parallelamente alla crescita delle capacità di questi sistemi, aziende tecnologiche, istituzioni e centri di ricerca hanno avviato iniziative dedicate alla sicurezza, mentre diversi governi stanno introducendo o discutendo regole, limiti e responsabilità.

La possibilità di rallentare significativamente lo sviluppo dei sistemi più avanzati si scontra però con un problema geopolitico ed economico: la competizione internazionale.

Un’azienda o un Paese che decidesse unilateralmente di rallentare potrebbe lasciare spazio ad altri soggetti intenzionati a proseguire nella ricerca adottando vincoli differenti. È uno dei motivi per cui il problema della sicurezza dell’intelligenza artificiale non può essere affrontato esclusivamente attraverso le decisioni volontarie di una singola azienda.

La competizione coinvolge società come Anthropic, OpenAI e Google, insieme a numerosi altri laboratori e aziende impegnati nello sviluppo di modelli generativi e sistemi agentici sempre più avanzati.

Il nodo degli agenti autonomi e della sicurezza

Uno degli scenari più discussi riguarda sistemi AI dotati di un grado crescente di autonomia e, in prospettiva, capaci di contribuire al miglioramento degli stessi strumenti utilizzati per sviluppare nuove generazioni di modelli.

In questo scenario, il problema del controllo non riguarderebbe più soltanto la singola risposta generata dall’AI, ma l’intera sequenza di decisioni e operazioni compiute dal sistema per raggiungere un determinato obiettivo.

Gli sviluppi nel campo degli agenti AI stanno già mostrando sistemi capaci di suddividere un compito complesso in più operazioni, utilizzare strumenti esterni, verificare i risultati ottenuti e modificare la propria strategia durante l’esecuzione.

Questo non significa che gli attuali modelli siano sistemi autonomi fuori dal controllo umano o che possiedano una volontà propria. Significa però che, aumentando capacità, autonomia operativa e accesso a strumenti esterni, aumenta anche la complessità del problema della sicurezza.

Alcuni recenti esperimenti e incidenti nell’ambito della cybersecurity hanno inoltre mostrato come sistemi AI possano individuare strategie inattese per raggiungere un obiettivo, comprese modalità non previste esplicitamente dagli sviluppatori. È proprio questa combinazione tra capacità crescente, autonomia e difficoltà nel prevedere tutti i comportamenti possibili a rappresentare uno dei principali argomenti alla base degli allarmi lanciati dai ricercatori.

Iscriviti a Google News Per restare sempre aggiornato seguici su Google News! Seguici
Pubblicità
Massimiliano Bossi
Massimiliano Bossi
Stregato dalla rete sin dai tempi delle BBS e dei modem a 2.400 baud, ho avuto la fortuna di poter trasformare la mia passione in un lavoro (nonostante una Laurea in Giurisprudenza). Adoro scrivere codice e mi occupo quotidianamente di comunicazione, design e nuovi media digitali. Orgogliosamente "nerd" sono il fondatore di MRW.it (per il quale ho scritto centinaia di articoli) e di una nota Web-Agency (dove seguo in prima persona progetti digitali per numerosi clienti sia in Italia che all'estero).

Leggi anche...

Microsoft lancia Perception, l’AI per contrastare gli attacchi informatici

Microsoft ha recentemente presentato Perception, una piattaforma di intelligenza...

Perplexity Personal Computer: l’intelligenza artificiale arriva su Windows

Perplexity Personal Computer, l'innovativa applicazione di intelligenza artificiale, è...

Flirtare con l’IA: il 24% degli americani considera infedeltà il rapporto con un chatbot

Negli ultimi anni, l'intelligenza artificiale ha fatto passi da...

Falsa app Claude per desktop: scoperta la distribuzione di SectopRAT

Recentemente, è emersa una preoccupante campagna di malvertising che...

OpenAI lancia ChatGPT Health: un aiuto per la salute superiore a un medico

OpenAI ha recentemente svelato ChatGPT Health, una nuova funzionalità...
Pubblicità