Murali Krishnam

ARCHIVIAZIONE DEI DATI DEGLI STUDI CLINICI — PARTE 2/5

La prima parte di questa serie ha trattato la prima dimensione: dai centri di costo alle risorse strategiche. Questo articolo si concentra sulla seconda dimensione: come i dati retrospettivi diventano dati di addestramento per i modelli di IA/ML. Nel gennaio 2026, la FDA e l'EMA hanno pubblicato congiuntamente i "Principi guida per una buona pratica di IA nello sviluppo di farmaci", un quadro di riferimento condiviso per la creazione, la documentazione e la convalida dei modelli di IA nello sviluppo di farmaci. Questo documento fa seguito alla bozza di linee guida sull'IA della FDA del gennaio 2025 e si basa sul "Consiglio sull'IA" del CDER del 2024. Il CDER ha già esaminato oltre 500 documenti relativi all'IA dal 2016.

Leggendo tra le righe, però, il vero punto cruciale non è il modello in sé, ma i dati su cui è stato addestrato. Un modello è credibile solo quanto i dati di addestramento utilizzati: quanto sono rappresentativi, quanto sono etichettati in modo coerente, quanto sono tracciabili. Gli enti regolatori non si limitano più a chiedere "funziona?", ma "da dove provengono i dati di addestramento e potete dimostrarlo?".

A questa domanda esiste già una risposta concreta, la stessa con cui è iniziata questa serie di articoli. L'approvazione da parte della FDA nel 2020 di Koselugo (selumetinib) per la neurofibromatosi di tipo 1 pediatrica, di cui abbiamo parlato nella Parte 1, si è basata su un gruppo di controllo esterno, derivato da uno studio sulla storia naturale della malattia e dai dati archiviati del gruppo placebo di una precedente sperimentazione di Fase II, anziché arruolare una nuova coorte placebo in una popolazione pediatrica affetta da una malattia estremamente rara. Si tratta di un risultato normativo pubblicato e quantificato, ottenuto presupponendo lo stesso requisito fondamentale per qualsiasi addestramento di un'intelligenza artificiale: dati archiviati, puliti e strutturati a sufficienza per l'addestramento e tracciabili per poter essere difesi dalle autorità regolatorie.

Niente di tutto ciò si ottiene semplicemente puntando il modello a una cartella contenente vecchi dati di studi clinici. La trasformazione di un archivio in dati di addestramento utilizzabili segue un processo piuttosto coerente, e Koselugo ne aveva già descritto la maggior parte all'epoca, anche se nessuno lo chiamava così.

  • Armonizzare a un modello dati comune. Il gruppo di controllo esterno di Koselugo ha riunito circa 50 pazienti provenienti da uno studio sulla storia naturale della malattia e circa 50 pazienti provenienti dal precedente braccio placebo dello studio SPRINT di Fase II. Nessuna delle due fonti condivideva un modello di dati, pertanto il volume del tumore, le finestre temporali per le visite e le definizioni degli endpoint hanno dovuto essere rimappati in un'unica struttura prima che fosse possibile confrontare i dati di ciascun paziente tra le due fonti.
  • Riconciliare la terminologia e ricavare nuovamente le etichette. La "risposta" e la progressione della malattia sono state ricalcolate utilizzando una definizione coerente in entrambi gli studi, e non in base a quella utilizzata dagli statistici di ciascuno studio originale.
  • De-identificare e collegare i dati a livello del singolo paziente. Ogni record proveniente da entrambe le fonti viene tokenizzato allo stesso modo, in modo che i pazienti possano essere raggruppati senza rivelare la loro identità o essere conteggiati due volte se compaiono in più di una fonte.
  • Progettare un set di funzionalità di base standard. Età, volume tumorale di base, genotipo e gravità della malattia vengono tutti estratti in un unico vettore di caratteristiche coerente: gli stessi campi, misurati nello stesso modo, per ogni paziente indipendentemente dalla fonte.
  • Filtrare per selezionare la coorte idonea, quindi associare input e output. Applicare i criteri di ammissibilità del nuovo studio a entrambi gli archivi, restringendo il gruppo ai circa 50 pazienti per fonte che effettivamente soddisfano i requisiti, quindi associare le caratteristiche di base di ciascun paziente (input) al risultato registrato (target).
  • Corrispondere o modellare la traiettoria del risultato. Koselugo ha utilizzato l'approccio più semplice: l'abbinamento basato sulla similarità, in cui i risultati effettivi di pazienti storici comparabili fungono da termine di paragone. L'alternativa più complessa, un modello generativo che campiona traiettorie sintetiche, rappresenta l'estremità più recente e meno testata dello stesso spettro.
  • Offrire interi studi in miniatura. Koselugo ha aggregato solo due studi di origine, ma il principio rimane lo stesso: i revisori dovevano avere la certezza che i pazienti del gruppo di confronto non fossero influenzati dai dati del braccio di trattamento, ovvero lo stesso isolamento che la pubblicazione di uno studio completo garantisce su scala più ampia.
  • Calibrare in base ai risultati reali. I revisori della FDA dovevano verificare che le caratteristiche di base e le traiettorie dei pazienti abbinati corrispondessero effettivamente a quelle della coorte trattata prima di accettare il confronto: lo stesso controllo necessario per qualsiasi versione di questa procedura prima che i suoi risultati siano considerati attendibili.
  • Reinserisci i risultati nell'archivio. Il comparatore di Koselugo è stato creato una sola volta, per una singola presentazione. Una pipeline riutilizzabile lo trasforma in un archivio continuamente aggiornato: la "supervisione del ciclo di vita" richiesta dai principi FDA/EMA e a cui mira il progetto pilota Real-Time Clinical Trials del blog Part 1.
archiviazione dei dati degli studi clinici - parte 2

I principi FDA/EMA richiedono una "gestione rigorosa della qualità e della provenienza delle informazioni", ma non specificano come, poiché il quadro di riferimento deve essere flessibile e applicabile alla progettazione degli studi clinici, alla farmacovigilanza e alla produzione. È qui che interviene la norma ISO/IEC 42001:2023. Pubblicata nel dicembre 2023 come primo standard internazionale per la gestione dell'IA, richiede alle organizzazioni certificate di eseguire valutazioni documentate dei rischi e dei bias, di mantenere la tracciabilità dei dati lungo tutto il ciclo di vita dell'IA e di conservare una traccia di audit che le autorità di regolamentazione possano esaminare. Per questo motivo, nel settore delle scienze biologiche, si sta già affermando come la soluzione pratica per costruire la fiducia di FDA, EMA e MHRA prima ancora che diventi obbligatoria.

Quel "come" si traduce in requisiti concreti che corrispondono direttamente alla norma ISO 42001, e i principi FDA/EMA li rendono quasi obbligatori:

  • Coorti rappresentative e sottoposte a verifica di assenza di bias (requisito di valutazione dei bias della norma ISO 42001). Gli sponsor devono verificare chi ha partecipato agli studi clinici archiviati e chi no prima di procedere all'addestramento, altrimenti un "gemello digitale" non farà altro che riproporre vecchi punti ciechi come verità cliniche.
  • Etichette strutturate, non testo libero (requisito di integrità dei dati della norma ISO 42001). Gli studi più datati spesso registravano i risultati in moduli di raccolta dati non strutturati. È necessario prima normalizzarli in etichette coerenti e strutturate, e non limitarsi a ciò che un codificatore ha digitato anni fa.
  • Tracciabilità a livello di studio (requisito di tracciabilità della norma ISO 42001). Gli sponsor devono sapere esattamente quali pazienti e studi fanno parte del set di addestramento e quali del set di validazione, altrimenti un modello può sembrare validato mentre in realtà non fa altro che memorizzare dati già visti.
  • Schede dati versionate (requisito di tracciabilità previsto dalla norma ISO 42001). I principi FDA/EMA impongono agli sponsor di documentare i dati relativi alla formazione stessa — provenienza, versione, limitazioni note — con lo stesso rigore del modello.
  • Calcolo che preserva la privacy per la condivisione dei dati tra gli sponsor. Nessun singolo archivio contiene da solo un numero sufficiente di pazienti. L'apprendimento federato e i dati sintetici consentono a più organizzazioni di addestrare un modello condiviso senza che i dati grezzi dei pazienti lascino mai il sistema di origine.
  • Rilevamento della deriva (principio di supervisione del ciclo di vita della FDA/EMA). Un modello addestrato su dati del periodo 2015-2020 necessita di un controllo integrato per verificare quando la popolazione di un nuovo studio non assomiglia più a quella da cui ha appreso, altrimenti "validato" significa semplicemente "validato su una popolazione che non esiste più".
  • Un ciclo di revisione umana documentato (requisito di supervisione umana previsto da FDA/EMA). Gli esperti clinici hanno ancora bisogno di un metodo tracciabile per contestare o annullare i risultati dei modelli prima che questi influenzino una decisione normativa, in modo che il modello non abbia l'ultima parola.
mappatura della normativa sull'archiviazione dei dati delle sperimentazioni cliniche

Saltando anche solo uno di questi passaggi, i "dati di addestramento" non sono altro che vecchi dati con una nuova etichetta, che è esattamente il tipo di utilizzo dell'IA che le autorità di regolamentazione sono ora pronte a respingere.

Rendere l'archivio "pronto per l'IA" è solo metà del lavoro. L'ultimo articolo del mio collega riprende proprio da dove questo si interrompe: cosa succede quando ai dati gestiti vengono poste domande dirette, in linguaggio semplice e con le relative citazioni: Da pronto per l'IA ad attivato dall'IA: la comprensione dei dati e la richiesta di informazioni sono arrivate.

Se lavorate nel campo della biostatistica, della scienza dei dati o degli affari regolatori: quando la vostra organizzazione parla di "utilizzare l'IA sui nostri dati storici relativi alle sperimentazioni cliniche", qualcuno ha documentato i dati di addestramento con la stessa rigorosità riservata al modello, specificando provenienza, rappresentatività e tutto il resto?

Prossimo appuntamento di questa serie: la terza dimensione – come l'onere di archiviazione derivante da sistemi eterogenei e fusioni e acquisizioni si sta trasformando in un vantaggio unificato per la ricerca interterapeutica.

DOMANDE FREQUENTI

Come si possono utilizzare i dati archiviati delle sperimentazioni cliniche per addestrare modelli di intelligenza artificiale?

I dati archiviati delle sperimentazioni cliniche possono essere ripuliti, armonizzati, anonimizzati, etichettati e strutturati in set di dati di addestramento che aiutano i modelli di intelligenza artificiale ad apprendere da popolazioni di pazienti storiche, risultati delle sperimentazioni e modelli clinici.

Perché i dati degli studi clinici sono importanti per l'intelligenza artificiale nello sviluppo di farmaci?

I dati degli studi clinici forniscono prove storiche su popolazioni di pazienti, trattamenti, esiti, sicurezza e progressione della malattia, che possono aiutare i modelli di intelligenza artificiale a supportare lo sviluppo clinico e la progettazione degli studi.

Quali caratteristiche rendono i dati degli studi clinici adatti all'addestramento dell'intelligenza artificiale?

I dati degli studi clinici pronti per l'intelligenza artificiale devono essere rappresentativi, etichettati in modo coerente, armonizzati, tracciabili, anonimizzati e supportati da una chiara provenienza e da un sistema di governance.

Come devono essere preparati i dati storici degli studi clinici per l'intelligenza artificiale?

I dati storici devono essere standardizzati, armonizzati a modelli di dati comuni, mappati a una terminologia coerente, anonimizzati, validati e documentati con provenienza a livello di studio prima di essere utilizzati per l'addestramento dell'IA.

Perché la provenienza dei dati è importante per i modelli di intelligenza artificiale nella ricerca clinica?

La tracciabilità dei dati consente a ricercatori e autorità di regolamentazione di comprendere da dove provengono i dati di addestramento, come sono stati trasformati e quali studi e pazienti sono stati inclusi.

Come possono le organizzazioni ridurre i pregiudizi nei dati di addestramento dell'IA provenienti da studi clinici?

Le organizzazioni possono valutare se i set di dati storici rappresentano adeguatamente le popolazioni di pazienti rilevanti, identificare i gruppi mancanti o sottorappresentati e documentare le potenziali fonti di distorsione prima di addestrare i modelli.

Che cosa si intende per dati di studi clinici pronti per l'intelligenza artificiale?

I dati degli studi clinici pronti per l'IA sono dati strutturati, standardizzati, tracciabili, gestiti e leggibili dalle macchine, che possono essere utilizzati in sicurezza per lo sviluppo, la validazione e l'analisi dell'IA.

In che modo i dati archiviati degli studi clinici possono contribuire alla progettazione di futuri studi clinici?

I dati storici degli studi clinici possono aiutare a identificare le caratteristiche dei pazienti, i modelli di trattamento, gli esiti e altri segnali storici utili per la progettazione e la pianificazione di studi futuri.

Come dovrebbero essere validati i modelli di intelligenza artificiale che utilizzano dati provenienti da studi clinici?

I modelli devono essere valutati utilizzando set di dati di validazione appropriati, popolazioni rappresentative, separazione a livello di studio, calibrazione dei risultati e prove documentate a supporto del loro utilizzo previsto.

Perché la supervisione umana è importante quando si utilizza l'intelligenza artificiale nello sviluppo di farmaci?

La supervisione umana consente agli esperti clinici e normativi di esaminare, contestare o annullare i risultati dell'IA prima che questi influenzino importanti decisioni cliniche o normative.

Referenze

Murali Krishnam

Murali Krishnam

Vicepresidente - Strategia di prodotto, Intelligenza artificiale per il settore farmaceutico aziendale

In qualità di responsabile di Enterprise Pharma AI presso Solix, Murali opera nell'intero ecosistema delle scienze della vita per promuovere innovazioni tecnologiche che consentano scoperte scientifiche rivoluzionarie. Si dedica a coniugare la conoscenza umana con le tecnologie più avanzate per favorire un approccio orientato ai risultati in tutto il processo di scoperta e sviluppo dei farmaci.

In Solix, Murali ha ideato Semantic Content Library, una soluzione innovativa che infonde significato e intelligenza contestuale a set di dati clinici e relativi ai pazienti di diverse modalità, consentendo la creazione di prodotti dati pronti per l'intelligenza artificiale, che spaziano dalla scoperta di farmaci alla fase post-marketing.

ESCLUSIONE DI RESPONSABILITÀ: I CONTENUTI, LE OPINIONI E I PUNTI DI VISTA ESPRESSI IN QUESTO BLOG SONO ESCLUSIVAMENTE DELL'AUTORE/DEGLI AUTORI E NON RIFLETTONO LA POLITICA O LA POSIZIONE UFFICIALE DI SOLIX TECHNOLOGIES, INC., DELLE SUE AFFILIATE O DEI SUOI PARTNER. QUESTO BLOG È GESTITO IN MODO INDIPENDENTE E NON È REVISIONATO O APPROVATO DA SOLIX TECHNOLOGIES, INC. IN QUALIFICA UFFICIALE. TUTTI I MARCHI, I LOGHI E I MATERIALI PROTETTI DA COPYRIGHT DI TERZE PARTI QUI RIFERITI SONO DI PROPRIETÀ DEI RISPETTIVI TITOLARI. QUALSIASI UTILIZZO È RIGOROSAMENTE A SCOPO IDENTIFICATIVO, DI COMMENTO O DIDATTICO, AI SENSI DELLA DOTTRINA DEL FAIR USE (STATI UNITI COPYRIGHT ACT § 107 E EQUIVALENTI INTERNAZIONALI). NON È IMPLICITA ALCUNA SPONSORIZZAZIONE, APPROVAZIONE O AFFILIAZIONE CON SOLIX TECHNOLOGIES, INC. IL CONTENUTO VIENE FORNITO "COSÌ COM'È" SENZA GARANZIE DI ACCURATEZZA, COMPLETEZZA O IDONEITÀ PER QUALSIASI SCOPO. SOLIX TECHNOLOGIES, INC. DECLINA OGNI RESPONSABILITÀ PER AZIONI INTRAPRESE IN BASE A QUESTO MATERIALE. I LETTORI SI ASSUMONO LA PIENA RESPONSABILITÀ PER L'UTILIZZO DI QUESTE INFORMAZIONI. SOLIX RISPETTA I DIRITTI DI PROPRIETÀ INTELLETTUALE. PER PRESENTARE UNA RICHIESTA DI RIMOZIONE DMCA, INVIARE UN'E-MAIL A INFO@SOLIX.COM CON: (1) IDENTIFICAZIONE DELL'OPERA, (2) L'URL DEL MATERIALE CHE VIOLA, (3) I PROPRI DATI DI CONTATTO E (4) UNA DICHIARAZIONE DI BUONA FEDE. I RECLAMI VALIDI RICEVERANNO IMMEDIATA ATTENZIONE. ACCEDENDO A QUESTO BLOG, ACCETTI LA PRESENTE ESCLUSIONE DI RESPONSABILITÀ E I NOSTRI TERMINI DI UTILIZZO. IL PRESENTE CONTRATTO È REGOLATO DALLE LEGGI DELLA CALIFORNIA.