ChatGPT di OpenAI ora permette di caricare file audio per trascriverli, riassumerli e analizzarne il contenuto direttamente all’interno di una conversazione. La funzione è destinata agli abbonamenti a pagamento e agli spazi di lavoro, mentre non risulta disponibile per gli utenti del piano gratuito.
Riunioni, interviste e lezioni possono così essere trasformate in testi, appunti strutturati o sintesi. L’utente può inoltre porre domande sulla registrazione come farebbe con un documento, chiedendo all’intelligenza artificiale di individuare informazioni, organizzare i contenuti o chiarire alcuni passaggi.
Chi può usare la funzione audio di ChatGPT
L’accesso è attualmente associato agli abbonamenti a pagamento di ChatGPT e agli ambienti di lavoro, compresa l’offerta Enterprise. Gli utenti del piano gratuito non possono invece utilizzare questa modalità di caricamento.
OpenAI precisa che la disponibilità può cambiare in base al Paese, al modello selezionato, alla versione dell’applicazione e alle impostazioni configurate nello spazio di lavoro. Di conseguenza, la presenza dell’opzione può non essere uniforme tra account diversi, anche quando appartengono allo stesso tipo di abbonamento.
La novità riguarda soprattutto il modo in cui la tecnologia viene resa accessibile. La trascrizione automatica non è infatti nuova per OpenAI: prima di questa integrazione, gli sviluppatori potevano già affidarsi a Whisper e ai modelli GPT-4o Transcribe attraverso le API. Ora, invece, il caricamento può essere effettuato direttamente nell’interfaccia di ChatGPT, senza dover costruire un’applicazione o utilizzare codice.
Formati compatibili e limite di 512 MB
ChatGPT supporta diversi formati audio diffusi, tra cui MP3, WAV, FLAC, AAC, M4A e OGG. Il limite indicato da OpenAI è di 512 MB per singolo file, una soglia che può corrispondere a durate molto diverse in base alla qualità e alla compressione della registrazione.
Un file MP3 codificato a 128 kbit/s può arrivare, in teoria, a circa nove ore di audio prima di raggiungere quella dimensione. Un WAV stereo non compresso a 16 bit e 44,1 kHz, invece, può occupare 512 MB dopo circa cinquanta minuti. La durata effettiva gestibile dipende quindi dal formato utilizzato, dal bitrate e dalle caratteristiche della registrazione.
Il limite di 512 MB riguarda comunque il caricamento e non rappresenta una garanzia sulla conclusione della trascrizione. OpenAI segnala che le registrazioni lunghe possono essere suddivise in più sezioni quando è disponibile la funzione Data Analysis. I file particolarmente estesi, però, possono scadere prima che l’elaborazione venga completata.
Anche la qualità del risultato può variare in base alla lingua parlata. Rumori di fondo, audio poco nitido, sovrapposizione delle voci e presenza di più interlocutori possono rendere meno precisa la trascrizione prodotta dall’AI.
Le prove mostrano difficoltà con file lunghi
Il riconoscimento del file non implica necessariamente che ChatGPT riesca a trascriverlo fino alla fine. In una prova con una registrazione MP3 di circa un’ora e mezza, l’assistente ha identificato correttamente il file e ne ha indicato la durata, ma non è riuscito a completare l’elaborazione.
In alcuni casi ChatGPT può anche suggerire di ricorrere a un servizio esterno. Le prestazioni sembrano più affidabili con file brevi, anche se il caricamento non garantisce sempre un risultato corretto o immediato. L’utente deve quindi verificare che il testo generato corrisponda realmente all’intera registrazione.
La gestione delle interviste con più persone può richiedere ulteriori controlli. Durante una prova su un’intervista di circa 15 minuti, ChatGPT ha chiesto di dividere l’audio in due file. Dopo il nuovo caricamento, il sistema ha prodotto una trascrizione presentata come completa, ma il testo conteneva soltanto una delle due parti.
Per ottenere un risultato utilizzabile è stato necessario segnalare l’errore, chiedere all’assistente di verificare il materiale elaborato e correggere la prima interpretazione. Solo dopo un ulteriore passaggio ChatGPT ha riportato entrambe le sezioni nell’ordine corretto. Gli ultimi scambi, tuttavia, non includevano indicazioni temporali precise.
Perché la trascrizione deve essere verificata
OpenAI avverte che le trascrizioni generate dall’intelligenza artificiale possono contenere errori. La stessa cautela riguarda l’identificazione degli interlocutori, che può risultare poco affidabile quando più persone parlano nella stessa registrazione o intervengono con sovrapposizioni.
Il controllo umano resta quindi necessario soprattutto per contenuti professionali, interviste, riunioni e lezioni. Prima di utilizzare il testo prodotto da ChatGPT, è opportuno confrontarlo con l’audio originale, controllare che non manchino parti della registrazione e verificare nomi, numeri e dichiarazioni.
La funzione può essere utile per ottenere rapidamente una prima bozza, un riassunto o una struttura di appunti, ma non va considerata come una trascrizione automatica infallibile. Anche un file relativamente breve può essere elaborato solo parzialmente o restituito senza una separazione precisa tra i diversi interlocutori.

