ARCHIVAGE DES DONNÉES DES ESSAIS CLINIQUES — PARTIE 2/5
La première partie de cette série traitait de la première dimension : le passage des centres de coûts aux actifs stratégiques. Cet article aborde la deuxième dimension : comment les données rétrospectives deviennent des données d’entraînement pour les modèles d’IA/ML. En janvier 2026, la FDA et l’EMA ont publié conjointement les « Principes directeurs de bonnes pratiques en matière d’IA dans le développement des médicaments », un cadre commun pour la conception, la documentation et la validation des modèles d’IA dans ce contexte. Ce document fait suite au projet de lignes directrices de la FDA sur l’IA de janvier 2025 et s’appuie sur les travaux du « Conseil de l’IA » du CDER de 2024. Le CDER a déjà examiné plus de 500 soumissions liées à l’IA depuis 2016.
Mais entre les lignes, on s'aperçoit que le véritable enjeu n'est pas le modèle lui-même, mais les données sur lesquelles il a été entraîné. La crédibilité d'un modèle dépend de la qualité de ses données d'entraînement : leur représentativité, la cohérence de leur étiquetage et leur traçabilité. Les organismes de réglementation ne se contentent plus de demander « est-ce que ça fonctionne ? ». Ils demandent « d'où proviennent les données d'entraînement et pouvez-vous le prouver ? »
Cette question a déjà une réponse concrète, celle-là même qui a ouvert cette série d'articles. L'approbation par la FDA, en 2020, du Koselugo (sélumétinib) d'AstraZeneca et Merck pour le traitement de la neurofibromatose de type 1 chez l'enfant, abordée dans la première partie, s'est appuyée sur un groupe contrôle externe constitué à partir d'une étude d'histoire naturelle et des données archivées du bras placebo d'un essai de phase II antérieur, plutôt que de recruter une nouvelle cohorte placebo au sein de cette population pédiatrique extrêmement rare. Il s'agit d'un résultat réglementaire publié et quantifié, qui reposait sur la même condition préalable que tout projet d'apprentissage automatique : des données archivées suffisamment propres et structurées pour l'apprentissage, et suffisamment traçables pour être défendues auprès des autorités réglementaires.
Rien de tout cela ne se produit simplement en indiquant au modèle un dossier contenant d'anciennes données d'essais cliniques. Transformer une archive en données d'entraînement utilisables suit un processus assez précis, dont Koselugo avait déjà décrit la majeure partie à l'époque, même si personne ne le nommait ainsi.
- Harmoniser selon un modèle de données commun. Le groupe témoin externe de Koselugo a regroupé environ 50 patients issus d'une étude d'histoire naturelle et environ 50 patients issus du groupe placebo de l'étude SPRINT de phase II. Les deux sources ne partageant pas de modèle de données, le volume tumoral, les périodes de visite et les définitions des critères d'évaluation ont dû être harmonisés avant toute comparaison entre les patients.
- Harmoniser la terminologie et redéfinir les étiquettes. La « réponse » et la progression de la maladie ont été recalculées selon une définition cohérente dans les deux études, et non selon celle utilisée à l'époque par les statisticiens de chaque étude originale.
- Dépersonnaliser et relier les données au niveau du patient. Chaque enregistrement provenant des deux sources est tokenisé de la même manière, ce qui permet de regrouper les patients sans révéler leur identité ni les compter deux fois s'ils apparaissent dans plusieurs sources.
- Concevoir un ensemble de fonctionnalités de base standard. L’âge, le volume tumoral initial, le génotype et la gravité de la maladie sont tous extraits dans un seul vecteur de caractéristiques cohérent — les mêmes champs, mesurés de la même manière, pour chaque patient quelle que soit la source.
- Filtrer pour obtenir une cohorte éligible, puis apparier les entrées et les résultats. Appliquez les nouveaux critères d'admissibilité de l'essai aux deux archives, en restreignant le groupe à environ 50 patients par source qui répondent réellement aux critères, puis associez les caractéristiques de base de chaque patient (entrée) à leur résultat enregistré (cible).
- Reproduire ou modéliser la trajectoire des résultats. Koselugo a utilisé l'approche la plus simple : l'appariement par similarité, où les résultats réels de patients comparables dans le passé servent de référence. L'alternative plus complexe, un modèle génératif échantillonnant des trajectoires synthétiques, représente l'extrémité la plus récente et la moins éprouvée de ce même spectre.
- Présenter des études entières, en miniature. Koselugo n'a regroupé que deux études sources, mais le même principe s'appliquait : les examinateurs avaient besoin d'être assurés que les patients du groupe comparateur n'étaient pas influencés par les données du groupe de traitement — la même isolation que celle que garantit, à plus grande échelle, la présentation d'une étude complète.
- Calibrer en fonction des résultats réels. Les examinateurs de la FDA devaient vérifier que les caractéristiques initiales et les trajectoires des patients appariés correspondaient bien à celles de la cohorte traitée avant d'accepter la comparaison — la même vérification dont toute version de ce processus a besoin avant que ses résultats ne soient considérés comme fiables.
- Réintégrer les résultats dans les archives. L'outil de comparaison de Koselugo a été conçu une seule fois, pour une seule demande d'autorisation. Un processus réutilisable permet de le transformer en une archive mise à jour en continu : le « suivi du cycle de vie » préconisé par les principes de la FDA et de l'EMA, et l'objectif du projet pilote d'essais cliniques en temps réel présenté dans la première partie du blog.
Les principes de la FDA et de l'EMA préconisent une « gestion rigoureuse de la qualité et de la provenance des informations », sans toutefois préciser les modalités, car le cadre doit s'appliquer à la conception des essais cliniques, à la pharmacovigilance et à la production. C'est là que la norme ISO/IEC 42001:2023 intervient. Publiée en décembre 2023, première norme internationale de gestion de l'IA, elle exige des organismes certifiés qu'ils réalisent des évaluations documentées des risques et des biais, assurent la traçabilité des données tout au long du cycle de vie de l'IA et conservent une piste d'audit consultable par les autorités réglementaires. C'est pourquoi, dans le secteur des sciences de la vie, elle est déjà présentée comme la solution pratique pour instaurer la confiance avec la FDA, l'EMA et la MHRA avant même que ces normes ne deviennent obligatoires.
Ce « comment » se décompose en exigences concrètes qui correspondent directement à la norme ISO 42001, et les principes de la FDA/EMA les rendent quasi obligatoires :
- Cohortes représentatives et auditées en matière de biais (exigence d'évaluation des biais de la norme ISO 42001). Avant toute formation, les promoteurs doivent vérifier qui a été inclus et qui n'a pas été inclus dans les essais archivés, sinon un « jumeau numérique » ne fera que réapprendre d'anciens angles morts comme vérité clinique.
- Étiquettes structurées, et non texte libre (exigence d'intégrité des données de la norme ISO 42001). Les essais cliniques plus anciens consignaient souvent leurs résultats dans des formulaires de rapport de cas non structurés. Il convient donc de les normaliser en utilisant des intitulés cohérents et structurés, et non pas de se contenter des informations saisies par un codeur il y a des années.
- Provenance au niveau de l'étude (exigence de traçabilité de la norme ISO 42001). Les commanditaires doivent savoir précisément quels patients et quelles études figurent dans l'ensemble d'entraînement par rapport à l'ensemble de validation, sinon un modèle peut sembler validé alors qu'il ne fait que mémoriser des données déjà vues.
- « Fiches de données » versionnées (exigence de traçabilité de la norme ISO 42001). Les principes de la FDA/EMA incitent les promoteurs à documenter les données de formation elles-mêmes — provenance, version, limitations connues — avec la même rigueur que le modèle.
- Calcul préservant la confidentialité pour la mise en commun entre plusieurs sponsors. Aucun système d'archivage ne contient à lui seul suffisamment de données de patients. L'apprentissage fédéré et les données synthétiques permettent à plusieurs organisations d'entraîner un modèle partagé sans que les données brutes des patients ne quittent jamais leur système source.
- Détection de la dérive (principe de surveillance du cycle de vie de la FDA/EMA). Un modèle entraîné sur des données de 2015 à 2020 doit comporter un mécanisme de vérification intégré permettant de déterminer si la population d'un nouvel essai ne ressemble plus à celle dont il a tiré des enseignements, ou si « validé » signifie simplement « validé sur une population qui n'existe plus ».
- Une boucle de contrôle humain documentée (exigence de surveillance humaine de la FDA/EMA). Les experts cliniques ont toujours besoin d'un moyen traçable de contester ou de modifier les résultats du modèle avant qu'ils n'influencent une décision réglementaire, afin que le modèle n'ait pas le dernier mot.
Omettez l'une de ces étapes et les « données d'entraînement » ne sont que de vieilles données auxquelles on a apposé une nouvelle étiquette, ce qui correspond exactement au type d'utilisation de l'IA que les organismes de réglementation sont désormais en mesure de rejeter.
Rendre les archives « prêtes pour l’IA » ne représente que la moitié du travail. Le dernier article de mon collègue reprend là où nous nous arrêtons : que se passe-t-il lorsque ces données gouvernées sont interrogées directement, en langage clair et avec des citations ? De l’état « prêt pour l’IA » à l’état « activé par l’IA » : Data Sense et Data Ask sont là.
Si vous travaillez dans les domaines de la biostatistique, des sciences des données ou des affaires réglementaires : lorsque votre organisation parle d’« utiliser l’IA sur nos données d’essais historiques », est-ce que quelqu’un a documenté les données d’entraînement elles-mêmes avec autant de rigueur que le modèle — provenance, représentativité, etc. ?
Prochain article de cette série : troisième dimension – comment la charge archivistique issue de systèmes disparates et des fusions-acquisitions se transforme en un avantage unifié pour la recherche interthérapeutique.
FAQ
Comment les données archivées d'essais cliniques peuvent-elles être utilisées pour entraîner des modèles d'IA ?
Les données archivées des essais cliniques peuvent être nettoyées, harmonisées, anonymisées, étiquetées et structurées en ensembles de données d'entraînement qui aident les modèles d'IA à apprendre des populations de patients historiques, des résultats des essais et des schémas cliniques.
Pourquoi les données des essais cliniques sont-elles importantes pour l'IA dans le développement de médicaments ?
Les données des essais cliniques fournissent des preuves historiques sur les populations de patients, les traitements, les résultats, la sécurité et l'évolution de la maladie, qui peuvent aider les modèles d'IA à soutenir le développement clinique et la conception des essais.
Qu’est-ce qui rend les données d’essais cliniques adaptées à l’entraînement de l’IA ?
Les données d'essais cliniques compatibles avec l'IA doivent être représentatives, étiquetées de manière cohérente, harmonisées, traçables, anonymisées et étayées par une provenance et une gouvernance claires.
Comment préparer les données historiques des essais cliniques pour l'IA ?
Les données historiques doivent être standardisées, harmonisées selon des modèles de données communs, mises en correspondance avec une terminologie cohérente, anonymisées, validées et documentées avec une provenance au niveau de l'étude avant d'être utilisées pour l'entraînement de l'IA.
Pourquoi la provenance des données est-elle importante pour les modèles d'IA dans la recherche clinique ?
La provenance des données permet aux chercheurs et aux organismes de réglementation de comprendre d'où proviennent les données d'entraînement, comment elles ont été transformées et quelles études et quels patients ont été inclus.
Comment les organisations peuvent-elles réduire les biais dans les données d'entraînement de l'IA issues des essais cliniques ?
Les organisations peuvent évaluer si les ensembles de données historiques représentent adéquatement les populations de patients concernées, identifier les groupes manquants ou sous-représentés et documenter les sources potentielles de biais avant d'entraîner les modèles.
Que sont les données d'essais cliniques prêtes pour l'IA ?
Les données d'essais cliniques compatibles avec l'IA sont des données structurées, standardisées, traçables, gouvernées et lisibles par machine qui peuvent être utilisées en toute sécurité pour le développement, la validation et l'analyse de l'IA.
Comment les données archivées des essais cliniques peuvent-elles aider à concevoir les futurs essais cliniques ?
Les données historiques des essais cliniques peuvent aider à identifier les caractéristiques des patients, les schémas de traitement, les résultats et d'autres signaux historiques qui éclairent la conception et la planification des essais futurs.
Comment valider les modèles d'IA utilisant des données d'essais cliniques ?
Les modèles doivent être évalués à l'aide d'ensembles de données de validation appropriés, de populations représentatives, d'une séparation au niveau de l'étude, d'un étalonnage des résultats et de preuves documentées qui appuient leur utilisation prévue.
Pourquoi la supervision humaine est-elle importante lors de l'utilisation de l'IA dans le développement de médicaments ?
La supervision humaine permet aux experts cliniques et réglementaires d'examiner, de contester ou de modifier les résultats de l'IA avant qu'ils n'influencent des décisions cliniques ou réglementaires importantes.
Références
- FDA américaine, « Intelligence artificielle pour le développement de médicaments » ; FDA/EMA, « Principes directeurs de bonnes pratiques en matière d'IA dans le développement de médicaments » (janvier 2026) ; Jones Day, « L'EMA et la FDA s'accordent sur les bonnes pratiques en matière d'IA dans le développement de médicaments » fda.gov/about-fda/center-drug-evaluation-and-research-cder/artificial-intelligence-drug-development | ema.europa.eu/en/documents/other/guiding-principles-good-ai-practice-drug-development_en.pdf | jonesday.com/en/insights/2026/01/ema-and-fda-align-on-good-ai-practice-in-drug-development
- Norme ISO/IEC 42001:2023 ; Axendia, « La norme d’IA que les sciences de la vie ne peuvent se permettre d’ignorer » — iso.org/standard/42001 | axendia.com/blog/2025/08/11/iso-iec-420012023-the-ai-standard-life-sciences-cant-afford-to-ignore
- Wiley Journal of Chemistry, analyse critique du projet de lignes directrices de la FDA sur l'IA — onlinelibrary.wiley.com/doi/10.1155/joch/5202999
- Clinical Trials Arena, « Bras de contrôle externes » (Koselugo) — clinicaltrialsarena.com/features/external-control-arms
AVERTISSEMENT : LE CONTENU, LES POINTS DE VUE ET LES OPINIONS EXPRIMÉS DANS CE BLOG SONT LA RESPONSABILITÉ EXCLUSIVE DES AUTEURS ET NE REFLÈTENT PAS LA POLITIQUE OU LA POSITION OFFICIELLE DE SOLIX TECHNOLOGIES, INC., DE SES SOCIÉTÉS AFFILIÉES OU DE SES PARTENAIRES. CE BLOG EST EXPLOITÉ DE MANIÈRE INDÉPENDANTE ET N'EST NI RÉVISÉ NI APPROUVÉ PAR SOLIX TECHNOLOGIES, INC. À TITRE OFFICIEL. TOUTES LES MARQUES, LOGOS ET DOCUMENTS PROTÉGÉS PAR LE DROIT D'AUTEUR TIERS MENTIONNÉS DANS CE BLOG APPARTIENNENT À LEURS PROPRIÉTAIRES RESPECTIFS. TOUTE UTILISATION EST STRICTEMENT À DES FINS D'IDENTIFICATION, DE COMMENTAIRE OU ÉDUCATIVES CONFORMÉMENT À LA DOCTRINE DE L'US FAIR USE (US COPYRIGHT ACT § 107 ET ÉQUIVALENTS INTERNATIONAUX). AUCUN PARRAINAGE, AUCUNE APPROBATION OU AFFILIATION AVEC SOLIX TECHNOLOGIES, INC. N'EST IMPLICITE. LE CONTENU EST FOURNI « EN L'ÉTAT », SANS GARANTIE D'EXACTITUDE, D'EXHAUSTIVITÉ OU D'ADÉQUATION À UN USAGE PARTICULIER. SOLIX TECHNOLOGIES, INC. DÉCLINE TOUTE RESPONSABILITÉ POUR LES ACTIONS PRISES SUR LA BASE DE CE MATÉRIEL. LES LECTEURS ASSUMENT L'ENTIÈRE RESPONSABILITÉ DE LEUR UTILISATION DE CES INFORMATIONS. SOLIX RESPECTE LES DROITS DE PROPRIÉTÉ INTELLECTUELLE. POUR SOUMETTRE UNE DEMANDE DE RETRAIT DMCA, ENVOYEZ UN E-MAIL À INFO@SOLIX.COM AVEC : (1) L'IDENTIFICATION DE L'ŒUVRE, (2) L'URL DU MATÉRIEL CONTREFAÇANT, (3) VOS COORDONNÉES ET (4) UNE DÉCLARATION DE BONNE FOI. TOUTE RÉCLAMATION VALIDE RECEVRA UNE EXAMEN RAPIDE. EN ACCÉDANT À CE BLOG, VOUS ACCEPTEZ CET AVIS DE NON-RESPONSABILITÉ ET NOS CONDITIONS D'UTILISATION. CE CONTRAT EST RÉGI PAR LES LOIS DE LA CALIFORNIE.
-
PublicationArchitecture de l'information d'entreprise pour l'IA générale et l'apprentissage automatique
Télécharger le livre blanc -
-
-
PublicationIntelligence d'entreprise : construire les bases du succès de l'IA
Télécharger le livre blanc