El despliegue de Elsa en la FDA: preocupaciones regulatorias, posibles consecuencias y un camino a seguir
Un examen crítico del despliegue de IA de la FDA, sus fallos y un marco SMART para una IA regulatoria responsable en ciencias de la vida.


En junio de 2025, la U.S. Food and Drug Administration (FDA) lanzó Elsa, una copiloto de IA generativa diseñada para agilizar los flujos de trabajo regulatorios. Si bien inicialmente fue celebrada, el despliegue de Elsa reveló rápidamente fallas críticas: citas alucinadas, datos de seguridad omitidos y brechas de gobernanza. Este artículo examina las deficiencias de Elsa, las contextualiza dentro de las tendencias más amplias de gobernanza de IA y propone un marco SMART (Specific, Measurable, Achievable, Relevant, Time-bound) para guiar la integración responsable de la IA en las ciencias de la vida. Basándonos en ideas de “Illuminating the Dark Side of Pharma Algorithms”, ofrecemos un camino hacia IA regulatorias transparentes, auditables y éticamente fundamentadas.
Introducción: un lanzamiento prometedor, una trayectoria problemática
El 2 de junio de 2025, la FDA emitió un comunicado de prensa anunciando el lanzamiento a nivel institucional de Elsa, destacando que la herramienta se puso en funcionamiento "ahead of schedule and under budget" tras un piloto exitoso [1]. Construida dentro de un entorno seguro GovCloud, se esperaba que Elsa ayudara a resumir informes de eventos adversos, comparar etiquetas y redactar código, liberando a los revisores para que se centraran en juicios científicos de alto valor. Sin embargo, a finales de julio, varios medios informaron la frustración del personal por citas fabricadas y datos de seguridad faltantes [2–6].
Cuando la IA socava la fidelidad regulatoria: modos de fallo
Las preocupaciones sobre la fiabilidad de Elsa surgieron casi de inmediato, particularmente en torno a las citas alucinadas. Se han observado desafíos similares en evaluaciones más amplias de LLM, donde el contenido generado por IA confiere una credibilidad indebida a afirmaciones no respaldadas, distorsionando las evaluaciones beneficio–riesgo antes de que se detecten los errores [7, 8]. Aunque está pendiente una revisión formal de la FDA, nuestro análisis se basa en estas preocupaciones iniciales para resaltar líneas de falla críticas entre el entusiasmo tecnológico y la fiabilidad regulatoria. A continuación describimos los posibles modos de fallo informados.
Tabla 1. Fallas o errores de FDA ELSA y posibles modos de fallo informados en los medios
La seguridad del paciente es la piedra angular de la revisión regulatoria de la FDA. Paradójicamente, Elsa —diseñada para acelerar y mejorar los procesos regulatorios— pudo haber introducido nuevos riesgos relacionados con la confianza, la transparencia y la eficiencia operativa. Cabe destacar que Elsa se lanzó con la suposición de exactitud estatutaria en los puntos de referencia heredados y una supervisión humana responsable. El despliegue de Elsa —ausente de pruebas rigurosas o transparencia— puede ser una “canary in the coal mine”, señalando que incluso instituciones de salud pública de élite son vulnerables a la deriva algorítmica y a la degradación de la toma de decisiones.
¿Es la gobernanza de IA de EE. UU. demasiado laxa para la salud pública?
A diferencia del EU AI Act, que impone obligaciones legalmente vinculantes a los sistemas de alto riesgo a partir de 2024 [9], la política de EE. UU. enfatiza el avance de la innovación en IA para apoyar la competitividad económica y la seguridad nacional [10]. En ausencia del tipo de salvaguardas promulgadas en el marco de la UE, existe una preocupación creciente de que herramientas de IA de alto riesgo puedan desplegarse sin pruebas rigurosas, transparencia o responsabilidad.
Buenas Prácticas Lingüísticas (GLP): el lenguaje como herramienta regulatoria
En la regulación farmacéutica, un lenguaje ambiguo o engañoso puede erosionar la confianza y comprometer el cumplimiento. Abogamos por GLP no solo en el laboratorio sino también para el lenguaje: Good Linguistic Practices (GLP) —el uso estructurado de un lenguaje claro, coherente y anclado en el contexto en los flujos de trabajo regulatorios asistidos por IA [8]. Esto incluye no solo una mejor redacción sino también trazabilidad, validación y alineación con las normas legales y regulatorias existentes. GLP no es solo claridad; es responsabilidad.
La metodología Dueling Banjo: colaboración humano + IA
Para salvaguardar la integridad en la IA regulatoria, recomendamos la metodología Dueling Banjo, un modelo estructurado e iterativo que refuerza la co‑desarrollo humano‑IA:
1. Borrador inicial de la IA: El prompting guiado RAG orienta las respuestas generadas por la IA, un FDA Copilot o asistente genAI fundamentado en www.fda.gov, www.ecfr.gov, etc. sitio(s), por ejemplo
2. Revisión experta y refinamiento: Los expertos en la materia evalúan la exactitud factual y la relevancia contextual. Proveer una búsqueda de texto completo Human‑in‑the‑Loop bajo demanda en las regulaciones publicadas de FDA.gov (Guidance PDFs y 21 CFRs) accesible desde la misma interfaz de la aplicación, asegurando así que nunca pueda establecerse un sesgo de LLM genAI.
3. Reiteración de la IA: El modelo se ajusta finamente usando la retroalimentación de los expertos, es decir, una interacción máquina‑humano de ida y vuelta con genAI, verificación de hechos cuando se desee
4. Verificación final: Las salidas se auditan frente a puntos de referencia de cumplimiento. Esto podría implicar comparar los mismos prompts e instrucciones a genAI desde un segundo modelo fundacional LLM distinto del Anthropic Claude usado por la ELSA de la FDA.
Este ciclo continúa hasta que las salidas generadas por la IA cumplen con los estándares de calidad, transparencia y preparación regulatoria. Es importante que los revisores humanos estén capacitados no solo en el dominio regulatorio sino también en ingeniería de prompts de IA y flujos de trabajo de validación.
Protocolo de Contexto de Modelo (MCP): una columna vertebral regulatoria
La Figura 1 ilustra una arquitectura moderna que integra SharePoint Online (alojando documentos de la FDA), eSTARHelper/FDA Copilot (impulsado por ChatGPT-4.0) y contenido indexado de Microsoft Foundry, todo estructurado mediante el Model Context Protocol (MCP).
Figura 1. eSTARHelper’s pila tecnológica actual y futura de Copilot de la FDA — Hombre-Máquina con intervención humana (Human-in-the-Loop) respaldada por herramientas agenticas de IA puramente autónoma: (a) herramientas, (b) recursos y (c) prompts respaldados por el protocolo MCP
MCP es un estándar de código abierto que permite a los LLM interactuar de forma predecible con datos estructurados, bases de datos y herramientas —similar a un puerto USB-C para la IA. Soporta acceso plug‑and‑play a recursos validados, inyección dinámica de contexto y verificación de datos en tiempo real. Al incorporar MCP con herramientas como SmartSearch+, LLMs como Elsa pueden referenciar de forma fiable documentos de orientación de la FDA y las regulaciones 21 CFR emitidas por CDER, CBER y CDRH.
Mientras que la Generación Aumentada por Recuperación (RAG) fundamenta las respuestas de los LLM con datos externos, se limita a búsquedas pasivas. El llamado de funciones, una capacidad que permite a los LLM como GPT-4 interactuar con APIs externas o herramientas de software, habilita a los LLM para ejecutar tareas específicas o acceder a datos en tiempo real, pero carece de una gestión de contexto sólida. MCP salva ambas limitaciones, permitiendo razonamiento estructurado, invocación de herramientas y trazabilidad completa [11], atributos esenciales para la misión regulatoria de la FDA. En contextos regulatorios, esta capacidad permite que los LLM consulten bases de datos validadas o ejecuten evaluaciones basadas en reglas, asegurando que las respuestas estén fundamentadas en lógica estructurada —no solo en generación de lenguaje.
De los puntos ciegos a la gobernanza SMART
Basándonos en “Illuminating the Dark Side of Pharma Algorithms” [12], revisamos el marco SMART para abordar la opacidad algorítmica y los puntos ciegos éticos —uno que transforma principios abstractos en salvaguardas concretas.
Especificidad comienza con la definición clara del alcance de las herramientas de IA y sus límites decisorios. Los modelos generativos no deben invadir el juicio científico ni la interpretación regulatoria sin restricciones explícitas. Al delinear lo que la IA puede —y no puede— hacer, las agencias pueden prevenir excesos y preservar la pericia del dominio.
Medibilidad garantiza que las salidas de la IA se evalúen frente a conjuntos de datos validados y estándares de cumplimiento. Esto permite a los revisores detectar alucinaciones, omisiones o deriva temprano en el proceso, antes de que salidas erróneas influyan en decisiones regulatorias. Las métricas deben vincularse al desempeño en el mundo real, no solo a la confianza interna del modelo.
Alcanzabilidad requiere alinear las capacidades de la IA con los flujos de trabajo reales y la formación de los revisores humanos. Herramientas como Elsa deben aumentar —no abrumar— los procesos existentes. Expectativas irreales o sistemas mal integrados corren el riesgo de uso indebido, frustración y erosión de la confianza.
Relevancia enfatiza que la IA debe apoyar, no suplantar, la experiencia humana. En dominios de alto riesgo como la regulación farmacéutica, la sutileza contextual y el juicio ético son insustituibles. La IA debe diseñarse para mejorar la toma de decisiones humana, no para automatizarla por completo.
Plazo delimitado introduce ciclos regulares de auditoría y protocolos de vigilancia de sesgos. Los sistemas de IA evolucionan, y sin monitoreo continuo incluso modelos bien entrenados pueden degradarse o derivar. Las revisiones programadas garantizan que el rendimiento siga alineado con los estándares regulatorios y las prioridades de salud pública.
Juntos, estos principios conforman una columna vertebral resiliente para la IA regulatoria. Se refuerzan además con prácticas destacadas en “Illuminating the Dark Side of Pharma Algorithms”, incluyendo el rigor ALCOA+ para la procedencia de datos, explicabilidad por diseño y juntas de gobernanza multifuncionales. Al incorporar la gobernanza SMART en el ADN del despliegue de IA, las organizaciones de ciencias de la vida pueden pasar de una supervisión reactiva a una administración proactiva —transformando relatos cautelares en puntos de referencia de confianza.
Conclusión
El camino a seguir no es solo técnico—es ético, lingüístico e institucional. Elsa pudo haber errado, pero con las salvaguardas adecuadas, la próxima generación de IA regulatoria puede avanzar con confianza.
Al emplear un enfoque con intervención humana, que describimos como la Metodología Dueling Banjo con la implementación de eSTARHelper de su genAI FDA Copilot y SmartSearch+, los profesionales farmacéuticos pueden explorar la utilidad de los LLM dentro del ámbito de la ciencia regulatoria. Dicho enfoque puede reforzarse aún más aprovechando estándares como MCP. Este enfoque puede transformar lo que actualmente es un ejemplo cautelar en un punto de referencia de confianza digital y liderazgo en salud pública.
Referencias
| FDA. (Consultado el 31/07/2025).
2.Se supone que la inteligencia artificial de la FDA revolucionará las aprobaciones de medicamentos. Está inventando estudios inexistentes. | CNN Politics. (Consultado el 31/07/2025).
3.La IA Elsa de la FDA alucina estudios, dicen empleados. Tech Times. (Consultado el 31/07/2025).
4.La herramienta de IA Elsa de la FDA plantea dudas sobre precisión y supervisión—applied Clinical Trials. (Consultado el 31/07/2025).
5. La nueva IA de aprobación de medicamentos de la FDA está generando estudios falsos: informe. Gizmodo. (Consultado el 31/07/2025).
6. El despliegue de la IA de la FDA plantea preguntas sobre preparación y legalidad. BioSpace. (Consultado el 31/07/2025).
7. Mejorando la comunicación regulatoria y la toma de decisiones con un FDA de IA/ML Copilot y SmartSearch+. Pharma Now. (Consultado el 31/07/2025).
8. Avanzando hacia buenas prácticas lingüísticas en comunicaciones regulatorias asistidas por IA. Pharma Now. (Consultado el 31/07/2025).
9. AI Act: Moldeando el futuro digital de Europa. European Union. (Consultado el 31/07/2025).
10. Eliminando barreras para el liderazgo estadounidense en inteligencia artificial. The White House. (Consultado el 31/07/2025).
11. Mejorando el soporte a la decisión clínica y los conocimientos EHR mediante LLMs y el Model Context Protocol: un marco MCP-FHIR de código abierto . arXiv:2506.13800 [cs.SE], junio de 2025. (Consultado el 31/07/2025)12.
Iluminando el lado oscuro de los algoritmos farmacéuticos. Pharma Now. (Consultado el 31/07/2025).. Pharma Now. (Consultado el 31/07/2025).

Reporting on the science, business and regulation shaping the pharmaceutical industry.
Más en Pharma IT
Todos los artículos →
IA en ensayos clínicos: mejorar la eficiencia y ahorrar dinero

Cómo la IA está transformando la medicina personalizada para mejores resultados sanitarios

Discussion