Murali Krishnam

ARQUIVAMENTO DE DADOS DE ENSAIOS CLÍNICOS — PARTE 2/5

A Parte 1 desta série abordou a primeira dimensão — do centro de custos aos ativos estratégicos. Esta publicação aborda a segunda dimensão: como os dados retrospectivos se transformam em dados de treinamento para modelos de IA/ML. Em janeiro de 2026, a FDA e a EMA publicaram conjuntamente os “Princípios Orientadores de Boas Práticas de IA no Desenvolvimento de Medicamentos”, uma estrutura compartilhada para a construção, documentação e validação de modelos de IA no desenvolvimento de medicamentos. Essa estrutura dá continuidade à minuta de diretrizes de IA da FDA, de janeiro de 2025, e se baseia no “Conselho de IA” de 2024 do CDER. O CDER já analisou mais de 500 submissões relacionadas à IA desde 2016.

Mas, lendo nas entrelinhas, o verdadeiro problema não é o modelo em si, mas sim os dados com os quais ele foi treinado. Um modelo só é confiável se seus dados de treinamento forem representativos, consistentemente rotulados e rastreáveis. Os órgãos reguladores não perguntam mais apenas "funciona?". Eles perguntam "de onde vieram os dados de treinamento e você pode provar isso?".

Essa pergunta já tem uma resposta concreta — a mesma com a qual esta série de posts começou. A aprovação do Koselugo (selumetinibe) pela FDA em 2020 para neurofibromatose tipo 1 pediátrica, da AstraZeneca e da Merck, abordada inicialmente na Parte 1, utilizou um controle externo construído a partir de um estudo de história natural e do braço placebo arquivado de um ensaio clínico de Fase II anterior, em vez de recrutar uma nova coorte placebo em uma população pediátrica ultrarrara. Trata-se de um resultado regulatório publicado e quantificado — e dependeu do mesmo pré-requisito necessário para qualquer treinamento de IA: dados arquivados limpos e estruturados o suficiente para o treinamento e rastreáveis ​​o suficiente para serem defendidos perante os órgãos reguladores.

Nada disso acontece simplesmente apontando o modelo para uma pasta com dados antigos de ensaios clínicos. Transformar um arquivo em dados de treinamento utilizáveis ​​segue um fluxo de trabalho bastante consistente, e Koselugo já havia percorrido a maior parte dele naquela época, embora ninguém o chamasse assim.

  • Harmonizar com um modelo de dados comum. O grupo de controle externo de Koselugo reuniu aproximadamente 50 pacientes de um estudo de história natural com cerca de 50 pacientes do braço placebo da Fase II do estudo SPRINT. Como nenhuma das fontes compartilhava um modelo de dados, o volume do tumor, os intervalos de visita e as definições de desfecho tiveram que ser remapeados em uma única estrutura antes que qualquer paciente pudesse ser comparado entre as fontes.
  • Reconciliar a terminologia e derivar novamente os rótulos. Os conceitos de “resposta” e progressão da doença foram recalculados com base em uma definição consistente para ambos os estudos, e não na definição utilizada pelos estatísticos de cada estudo original na época.
  • Desidentificar e vincular dados ao nível do paciente. Cada registro de ambas as fontes é tokenizado da mesma maneira, para que os pacientes possam ser agrupados sem expor sua identidade ou serem contados duas vezes caso apareçam em mais de uma fonte.
  • Projete um conjunto de funcionalidades básicas padrão. A idade, o volume tumoral basal, o genótipo e a gravidade da doença são todos extraídos e reunidos em um vetor de características consistente — os mesmos campos, medidos da mesma forma, para cada paciente, independentemente da fonte.
  • Filtre para uma coorte elegível e, em seguida, emparelhe a entrada e o resultado. Aplique os critérios de elegibilidade do novo ensaio clínico a ambos os arquivos, reduzindo o grupo para aproximadamente 50 pacientes por fonte que realmente se qualificam e, em seguida, emparelhe as características basais de cada paciente (entrada) com o resultado registrado (alvo).
  • Reproduza ou modele a trajetória do resultado. Koselugo utilizou a abordagem mais simples: correspondência baseada em similaridade, onde os resultados reais de pacientes históricos comparáveis ​​servem como comparador. A alternativa mais complexa, um modelo generativo que amostra trajetórias sintéticas, é a extremidade mais recente e menos testada do mesmo espectro.
  • Realize estudos completos, em miniatura. Koselugo reuniu apenas dois estudos de origem, mas o mesmo princípio se aplicou: os revisores precisavam ter certeza de que os pacientes do grupo de comparação não eram influenciados pelos dados do grupo de tratamento — o mesmo isolamento que a realização de um estudo completo protege em maior escala.
  • Compare com resultados reais. Os revisores da FDA tiveram que verificar se as características basais e as trajetórias dos pacientes correspondentes correspondiam de fato às da coorte tratada antes de aceitar a comparação — a mesma verificação que qualquer versão desse processo precisa fazer para que seus resultados sejam considerados confiáveis.
  • Enviar resultados de volta para o arquivo. O comparador de Koselugo foi construído uma única vez, para uma única submissão. Um pipeline reutilizável transforma isso em um arquivo continuamente atualizado — a “supervisão do ciclo de vida” exigida pelos princípios da FDA/EMA, e que o projeto piloto de Ensaios Clínicos em Tempo Real do blog Part 1 busca alcançar.
arquivamento de dados de ensaios clínicos - parte 2

Os princípios da FDA/EMA exigem uma “gestão robusta da qualidade e proveniência da informação” — mas não especificam como, visto que a estrutura precisa ser flexível em todas as etapas, desde o planejamento de ensaios clínicos e farmacovigilância até a fabricação. É aí que a norma ISO/IEC 42001:2023 entra em cena. Publicada em dezembro de 2023 como a primeira norma internacional de gestão de IA (Inteligência Artificial), ela exige que as organizações certificadas realizem avaliações documentadas de risco e viés, mantenham os dados rastreáveis ​​ao longo de todo o ciclo de vida da IA ​​e preservem um registro de auditoria que possa ser revisado pelos órgãos reguladores. Por isso, ela já está sendo posicionada no setor de ciências da vida como a maneira prática de construir a confiança da FDA, EMA e MHRA antes mesmo de qualquer exigência se tornar obrigatória.

Esse “como” se desdobra em requisitos concretos que se alinham diretamente à norma ISO 42001, e os princípios da FDA/EMA os tornam praticamente obrigatórios:

  • Cohortes representativas e auditadas quanto a vieses (requisito de avaliação de viés da norma ISO 42001). Os patrocinadores devem verificar quem participou dos ensaios clínicos arquivados e quem não participou antes do treinamento, caso contrário, um "gêmeo digital" simplesmente reaprende antigas falhas clínicas como se fossem verdades absolutas.
  • Rótulos estruturados, não texto livre (requisito de integridade de dados da norma ISO 42001). Ensaios clínicos mais antigos frequentemente registravam os resultados em formulários de relato de caso não estruturados. É preciso normalizá-los primeiro, utilizando rótulos consistentes e estruturados, e não apenas o que um codificador digitou por acaso anos atrás.
  • Proveniência ao nível do estudo (requisito de rastreabilidade da norma ISO 42001). Os patrocinadores precisam saber exatamente quais pacientes e estudos compõem o conjunto de treinamento e quais compõem o conjunto de validação, caso contrário, um modelo pode parecer validado quando, na verdade, apenas memorizou dados que já havia visto.
  • “Cartões de dados” versionados (requisito de trilha de auditoria da ISO 42001). Os princípios da FDA/EMA incentivam os patrocinadores a documentar os próprios dados de treinamento — procedência, versão, limitações conhecidas — com o mesmo rigor que o modelo.
  • Computação que preserva a privacidade para compartilhamento de recursos entre patrocinadores. Nenhum arquivo individual possui pacientes suficientes por si só. O aprendizado federado e os dados sintéticos permitem que várias organizações treinem um modelo compartilhado sem que os dados brutos dos pacientes saiam do sistema de origem.
  • Detecção de deriva (princípio de supervisão do ciclo de vida da FDA/EMA). Um modelo treinado com dados de 2015 a 2020 precisa de uma verificação integrada para quando a população de um novo ensaio clínico não se assemelha mais àquela da qual o modelo foi treinado, ou quando "validado" simplesmente significa "validado em uma população que não existe mais".
  • Um processo de revisão humana documentado (expectativa de supervisão humana da FDA/EMA). Os especialistas clínicos ainda precisam de uma forma rastreável de contestar ou substituir os resultados do modelo antes que estes influenciem uma decisão regulatória, para que o modelo não tenha a palavra final.
mapeamento-regulatório-de-arquivamento-de-dados-de-ensaios-clínicos

Ignore qualquer um desses fatores e os "dados de treinamento" serão apenas dados antigos com um novo rótulo, que é exatamente o tipo de uso de IA que os órgãos reguladores estão agora em posição de rejeitar.

No entanto, tornar o arquivo "pronto para IA" é apenas metade da recompensa. O artigo mais recente do meu colega retoma exatamente de onde isso parou — o que acontece quando esses dados governados são questionados diretamente, em linguagem simples, com citações anexadas: De Pronto para IA a Ativado por IA: Análise e Questionamento de Dados Chegaram.

Se você trabalha em bioestatística, ciência de dados ou assuntos regulatórios: quando sua organização fala em "usar IA em nossos dados históricos de ensaios clínicos", alguém documentou os próprios dados de treinamento com o mesmo rigor que o modelo — procedência, representatividade e tudo mais?

A seguir nesta série: a terceira dimensão — como a sobrecarga de arquivos proveniente de sistemas díspares e fusões e aquisições está se transformando em uma vantagem unificada para a pesquisa interdisciplinar.

Perguntas Frequentes

Como os dados arquivados de ensaios clínicos podem ser usados ​​para treinar modelos de IA?

Os dados arquivados de ensaios clínicos podem ser limpos, harmonizados, anonimizados, rotulados e estruturados em conjuntos de dados de treinamento que ajudam os modelos de IA a aprender com populações históricas de pacientes, resultados de ensaios e padrões clínicos.

Por que os dados de ensaios clínicos são importantes para a IA no desenvolvimento de medicamentos?

Os dados de ensaios clínicos fornecem evidências históricas sobre populações de pacientes, tratamentos, resultados, segurança e progressão da doença, que podem ajudar os modelos de IA a apoiar o desenvolvimento clínico e o planejamento de ensaios.

O que torna os dados de ensaios clínicos adequados para o treinamento de IA?

Os dados de ensaios clínicos prontos para IA devem ser representativos, rotulados de forma consistente, harmonizados, rastreáveis, anonimizados e respaldados por procedência e governança claras.

Como os dados históricos de ensaios clínicos devem ser preparados para IA?

Os dados históricos devem ser padronizados, harmonizados com modelos de dados comuns, mapeados para terminologia consistente, anonimizados, validados e documentados com a proveniência em nível de estudo antes de serem usados ​​para treinamento de IA.

Por que a proveniência dos dados é importante para os modelos de IA na pesquisa clínica?

A proveniência dos dados permite que pesquisadores e órgãos reguladores entendam de onde vieram os dados de treinamento, como foram transformados e quais estudos e pacientes foram incluídos.

Como as organizações podem reduzir o viés nos dados de treinamento de IA provenientes de ensaios clínicos?

As organizações podem avaliar se os conjuntos de dados históricos representam adequadamente as populações de pacientes relevantes, identificar grupos ausentes ou sub-representados e documentar possíveis fontes de viés antes do treinamento dos modelos.

O que são dados de ensaios clínicos prontos para IA?

Os dados de ensaios clínicos prontos para IA são dados estruturados, padronizados, rastreáveis, regulamentados e legíveis por máquina, que podem ser usados ​​com segurança para o desenvolvimento, validação e análise de IA.

Como os dados arquivados de ensaios clínicos podem ajudar no planejamento de futuros ensaios clínicos?

Dados históricos de ensaios clínicos podem ajudar a identificar características dos pacientes, padrões de tratamento, resultados e outros sinais históricos que orientam o planejamento e a concepção de ensaios futuros.

Como devem ser validados os modelos de IA que utilizam dados de ensaios clínicos?

Os modelos devem ser avaliados utilizando conjuntos de dados de validação apropriados, populações representativas, separação ao nível do estudo, calibração dos resultados e evidências documentadas que sustentem a sua utilização pretendida.

Por que a supervisão humana é importante ao usar IA no desenvolvimento de medicamentos?

A supervisão humana permite que especialistas clínicos e regulatórios revisem, questionem ou anulem os resultados da IA ​​antes que eles influenciem decisões clínicas ou regulatórias importantes.

Referências

Murali Krishnam

Murali Krishnam

Vice-presidente de Estratégia de Produto, IA Empresarial para o Setor Farmacêutico

Como líder de IA para o setor farmacêutico empresarial na Solix, Murali trabalha em todo o ecossistema das ciências da vida para impulsionar inovações tecnológicas que possibilitem avanços científicos. Ele se dedica a combinar o conhecimento humano com tecnologia avançada para promover uma abordagem orientada a resultados em todo o processo de descoberta e desenvolvimento de medicamentos.

Na Solix, Murali foi pioneiro na Biblioteca de Conteúdo Semântico, uma solução inovadora que incorpora significado e inteligência contextual em conjuntos de dados clínicos e de pacientes multimodais, permitindo a criação de produtos de dados prontos para IA, abrangendo desde a descoberta de medicamentos até o pós-comercialização.

AVISO LEGAL: O CONTEÚDO, AS VISÕES E AS OPINIÕES EXPRESSAS NESTE BLOG SÃO EXCLUSIVAMENTE DO(S) AUTOR(ES) E NÃO REFLETEM A POLÍTICA OU POSIÇÃO OFICIAL DA SOLIX TECHNOLOGIES, INC., SUAS AFILIADAS OU PARCEIROS. ESTE BLOG É OPERADO DE FORMA INDEPENDENTE E NÃO É REVISADO OU ENDOSSADO PELA SOLIX TECHNOLOGIES, INC. EM SUA CAPACIDADE OFICIAL. TODAS AS MARCAS REGISTRADAS, LOGOTIPOS E MATERIAIS PROTEGIDOS POR DIREITOS AUTORAIS DE TERCEIROS AQUI REFERIDOS SÃO PROPRIEDADE DE SEUS RESPECTIVOS PROPRIETÁRIOS. QUALQUER USO É ESTRITAMENTE PARA FINS DE IDENTIFICAÇÃO, COMENTÁRIOS OU EDUCACIONAIS, DE ACORDO COM A DOUTRINA DO USO JUSTO (LEI DE DIREITOS AUTORAIS DOS EUA, § 107 E EQUIVALENTES INTERNACIONAIS). NÃO HÁ NENHUM PATROCÍNIO, ENDOSSO OU AFILIAÇÃO IMPLÍCITA COM A SOLIX TECHNOLOGIES, INC. O CONTEÚDO É FORNECIDO "NO ESTADO EM QUE SE ENCONTRA", SEM GARANTIAS DE PRECISÃO, INTEGRIDADE OU ADEQUAÇÃO A QUALQUER FIM. A SOLIX TECHNOLOGIES, INC. SE ISENTA DE TODA RESPONSABILIDADE POR AÇÕES TOMADAS COM BASE NESTE MATERIAL. OS LEITORES ASSUMEM TOTAL RESPONSABILIDADE PELO USO DESTAS INFORMAÇÕES. A SOLIX RESPEITA OS DIREITOS DE PROPRIEDADE INTELECTUAL. PARA ENVIAR UMA SOLICITAÇÃO DE REMOÇÃO DMCA, ENVIE UM E-MAIL PARA INFO@SOLIX.COM COM: (1) IDENTIFICAÇÃO DA OBRA, (2) URL DO MATERIAL INFRATOR, (3) SEUS DADOS DE CONTATO E (4) UMA DECLARAÇÃO DE BOA-FÉ. REIVINDICAÇÕES VÁLIDAS RECEBERÃO ATENÇÃO IMEDIATA. AO ACESSAR ESTE BLOG, VOCÊ CONCORDA COM ESTA ISENÇÃO DE RESPONSABILIDADE E COM NOSSOS TERMOS DE USO. ESTE CONTRATO É REGIDO PELAS LEIS DA CALIFÓRNIA.