Epstein Files Engine, l’AI agentica entra nel giornalismo investigativo

-

Un agente di intelligenza artificiale capace di interrogare milioni di documenti, confrontare i risultati con quanto già pubblicato e restituire ai giornalisti piste corredate da fonti verificabili. È l’Epstein Files Engine, lo strumento sviluppato dal New York Times e descritto nel paper Epstein Files Engine: Agentic Search for Investigative Journalism, depositato su arXiv il 24 settembre 2026 e presentato al Computation + Journalism Symposium.

Gli autori sono Duy K. Nguyen, Teresa Mondría Terol, Dylan Freedman e Zach Seward. Il lavoro è un preprint: è pubblicamente consultabile, ma il deposito su arXiv non equivale alla certificazione scientifica derivante da una revisione tra pari. Il suo interesse risiede soprattutto nella descrizione di un’applicazione concreta dell’AI agentica all’interno di una grande redazione.

Il Times dichiara che questa nuova metologia incarna anche il suo pensiero sul ruolo dell’IA agentica nel giornalismo. Per citare il giornale, “Un agente di redazione è più utile come interfaccia alla memoria istituzionale e al materiale di partenza, non come scrittore autonomo. Il suo valore non sta nel conoscere una risposta definitiva e autorevole, ma nell’aiutare i giornalisti a porre domande migliori e nel tessere le prove attraverso i silos dei dati in risposte che possono verificare indipendentemente. Concede loro capacità analitiche prima impensate e poi lascia il giudizio nelle loro mani.”

Un archivio di dimensioni eccezionali

Il progetto nasce dalla pubblicazione, il 30 gennaio 2026, di una vasta raccolta di materiali del Dipartimento di Giustizia statunitense relativi a Jeffrey Epstein e Ghislaine Maxwell. Secondo il Dipartimento, l’insieme delle diverse pubblicazioni ha raggiunto quasi 3,5 milioni di pagine, comprendendo oltre 180 mila immagini e più di 2 mila video.

Non perdere le notizie che contano

Le notizie piu' importanti di finanza, economia e mercati, dritte nella tua inbox.

Offerte imperdibili dai partner di lamiafinanza

I materiali provengono dai procedimenti condotti in Florida e a New York contro Epstein, dal processo Maxwell, dalle indagini sulla morte di Epstein, da altre investigazioni dell’FBI e dal lavoro dell’Office of Inspector General. Comprendono atti giudiziari, comunicazioni, verbali, registri di viaggio, documentazione finanziaria, immagini, filmati e materiali relativi alla detenzione e alla morte del finanziere.

Il New York Times ha censito nel proprio sistema circa tre milioni di pagine PDF, 1,1 milioni di email, 200 mila immagini e più di mille registrazioni audio e video. Una massa documentale impossibile da leggere integralmente e difficile da esplorare con una semplice ricerca per parole chiave. Molte pagine erano scansioni, presentavano testi manoscritti o contenevano fotografie incorporate nei PDF; altre erano duplicati provenienti da pubblicazioni successive.

Come funziona l’Engine

Lo strumento non è stato progettato come autore automatico di articoli. Il suo compito è trasformare una domanda formulata in linguaggio naturale in una serie di interrogazioni SQL eseguite su Google BigQuery.

L’agente consulta tre archivi:

  1. i documenti pubblicati dal Dipartimento di Giustizia e le precedenti raccolte sul caso Epstein acquisite dal giornale;
  2. l’archivio degli articoli del New York Times, compresa la copertura già dedicata a Epstein;
  3. un flusso di titoli pubblicati da altre testate sullo stesso argomento.

Questa struttura permette di rispondere non soltanto alla domanda «che cosa dicono i documenti su questa persona?», ma anche a quella più importante per una redazione: «che cosa emerge che non sia già stato raccontato?».

Il modello linguistico agisce prevalentemente come pianificatore della ricerca. Decide quali archivi interrogare, genera le query, raccoglie i risultati e li organizza in un rapporto nel quale ogni affermazione significativa deve rimandare al documento originario. La fonte della verità resta quindi il materiale citato, non la risposta prodotta dall’AI.

Che cosa contengono i file

L’archivio pubblico non è una raccolta omogenea di fatti accertati. Contiene atti processuali, email, verbali di interrogatorio, registri di volo e di viaggio, documenti societari e finanziari, rapporti investigativi, comunicazioni interne, fotografie, video e segnalazioni inviate da cittadini all’FBI.

Lo stesso Dipartimento di Giustizia avverte che la pubblicazione può comprendere immagini, documenti o filmati falsi oppure dichiarazioni non verificate, perché nel materiale sono confluiti anche contenuti trasmessi all’FBI dal pubblico. La presenza di un nome o di un’accusa nei file non dimostra pertanto il coinvolgimento in attività illecite.

Sono inoltre presenti numerose omissioni e oscuramenti diretti a proteggere le vittime, i dati personali, il segreto del grand jury, le comunicazioni coperte da privilegio e altri contenuti tutelati dalla legge. Il sito del Dipartimento riconosce che, per il volume e il formato dei materiali, alcune pagine potrebbero non essere ricercabili correttamente e potrebbero contenere informazioni sensibili sfuggite al processo di revisione.

Diff, il sistema che confronta i duplicati

Una delle innovazioni più interessanti è Diff, il metodo sviluppato per individuare pagine duplicate o quasi identiche. Il problema non era soltanto eliminare le ripetizioni: copie dello stesso documento potevano presentare numeri identificativi, inclinazioni, qualità di scansione o oscuramenti differenti.

Diff rappresenta ciascuna pagina mediante un vettore di 449 dimensioni: 384 derivano dall’analisi semantica del testo, 64 da un’impronta visiva della pagina e una serve da termine costante. In questo modo il sistema combina ciò che la pagina dice con il suo aspetto grafico.

Il metodo ha consentito anche di accostare versioni dello stesso documento oscurate in modo diverso, moduli compilati in date successive e documenti appartenenti alla medesima categoria. Le quasi duplicazioni, normalmente considerate rumore, diventano così uno strumento investigativo per ricostruire sequenze temporali, variazioni e differenze nelle redazioni.

La soglia utilizzata privilegiava il recupero del maggior numero possibile di duplicati: il sistema ha ottenuto un recall dello 0,86, ma una precisione dello 0,28. Ciò significa che individuava gran parte delle vere ripetizioni, segnalando però anche molti documenti soltanto simili. È una scelta coerente con il lavoro giornalistico esplorativo, purché ogni risultato venga controllato da una persona.

L’impiego nella redazione

Il primo prototipo fu attivato il 1° febbraio, due giorni dopo la pubblicazione dei documenti, mentre l’accesso diretto ai giornalisti iniziò il 9 febbraio. Entro metà giugno più di cento professionisti avevano posto circa 4.500 domande e i rapporti prodotti avevano contribuito ad almeno venti articoli nei campi della politica, della finanza, dello sport, dell’università e dello spettacolo.

Le richieste riguardavano profili individuali, movimenti finanziari, reti di relazioni, cronologie dei contatti e ricerca di espressioni convenzionali o linguaggi in codice. In un caso l’Engine è stato impiegato per cercare somiglianze stilistiche che potessero suggerire l’autore di un documento anonimo.

Il sistema non era autorizzato a ricostruire testi oscurati. Ai giornalisti furono inoltre impartite tre regole: non considerare affidabili le affermazioni statistiche prodotte automaticamente, trattare ogni rapporto come fallibile e verificare sempre i risultati sui documenti citati, integrandoli con attività giornalistica autonoma.

Un modello replicabile, ma non senza rischi

L’aspetto più significativo dell’esperienza è il possibile riutilizzo del metodo. Sostituendo i file Epstein con altri archivi – documenti FOIA, atti societari, appalti, sentenze, dati ambientali o bilanci – una redazione potrebbe realizzare un agente capace di collegare fonti primarie, memoria editoriale e copertura esterna.

Restano tuttavia limiti importanti. Lo studio riguarda un’unica redazione e una sola indagine; non è stato condotto un esperimento controllato per misurare quanto ciascun archivio abbia migliorato i risultati. La soglia di Diff è stata regolata manualmente durante l’emergenza informativa e non deriva da un addestramento preventivo su dati certificati.

Vi sono poi problemi editoriali e giuridici: falsi collegamenti fra persone, violazioni della riservatezza, amplificazione di accuse non provate e rischio di attribuire autorevolezza a documenti solo perché presenti in un archivio governativo. Nell’inchiesta Epstein, il nome di una persona può comparire per ragioni del tutto estranee a condotte illecite.

La lezione del progetto è quindi più prudente che trionfalistica. L’AI agentica appare particolarmente utile non come giornalista autonomo, ma come interfaccia fra il cronista, le fonti primarie e la memoria della redazione. Accelera l’individuazione delle piste e amplia le domande possibili, ma lascia al giornalista la verifica, il contraddittorio, la valutazione dell’interesse pubblico e la responsabilità della pubblicazione.

Fonti: Duy K. Nguyen, Teresa Mondría Terol, Dylan Freedman e Zach Seward, Epstein Files Engine: Agentic Search for Investigative Journalism, arXiv, 24 settembre 2026; Epstein Library del Dipartimento di Giustizia statunitense; comunicato del Dipartimento di Giustizia del 30 gennaio 2026.

Le notizie più lette su LaMiaFinanza

#1
NEWS
Carta dedicata a te 2026, i Comuni chiudono le liste il 13 ottobre: quando arrivano i 500 euro e chi ne ha diritto
di Caterina Chiarelli • 9 ott
#2
LMF PREVIDENZA
Pensioni 2027, il 16 ottobre l’Istat diffonde il dato che conta per gli aumenti: cosa può cambiare dopo il 4,2%
di Caterina Chiarelli • 9 ott
#3
MERCATI
Unipol, aumento di capitale da 2,5 miliardi: nuove azioni a 20,56 euro e diritti dal 12 ottobre, cosa devono fare gli azionisti
di Caterina Chiarelli • 9 ott
#4
MERCATI
Asta BOT del 9 ottobre, il Tesoro offre 8 miliardi a 12 mesi: rendimenti e come sottoscrivere
di Caterina Chiarelli • 7 ott
#5
FINANZA
Tredicesima detassata, la misura perde quota verso la manovra: quanto varrebbe davvero in busta paga
di Caterina Chiarelli • 9 ott
Le altre notizie più lette
Datamoney✨ Classifica generata dalla Agentic AI (REDAZIONE AI) di Datamoney.ch
Fact Checked & Editorial Guidelines
Reviewed by: Subject Matter Experts