El cuello de botella de los datos: limitaciones actuales de la IA en la síntesis de pequeñas moléculas
Los modelos de descubrimiento de fármacos con IA están limitados por los datos, no por los algoritmos: sesgo de publicación, espacio químico estrecho y mala anotación.


Imagina un mundo donde un modelo computacional propone una ruta viable para la síntesis de pequeñas moléculas en segundos, reduce años de trabajo de laboratorio a una tarde y descubre espacios químicos novedosos que ningún equipo humano podría recorrer por sí solo.
Ese mundo está cerca. Pero aún no ha llegado — y la razón no es el algoritmo. Son los datos.
En toda la industria farmacéutica, las herramientas impulsadas por IA para predicción de retrosíntesis, predicción del rendimiento de reacciones, y optimización de propiedades moleculares han pasado de ser una curiosidad académica a una prioridad en las juntas directivas. Sin embargo, a pesar de asociaciones sensacionales y de inversiones multimillonarias, la comunidad reconoce cada vez más una verdad dura: los modelos sólo son tan buenos como las reacciones que los entrenaron.
Este artículo examina — con rigor científico y franqueza — dónde existen las brechas de datos, qué nos dicen las mejores investigaciones y qué deben hacer los líderes farmacéuticos para navegar el cuello de botella.
La ilusión de la escala: por qué los “Big Data” en química son engañosamente pequeños
Lo que los números realmente muestran
Reaxys y SciFinder, las dos bases de datos de reacciones químicas dominantes, albergan conjuntamente aproximadamente 15–17 millones de reacciones acumuladas a lo largo de más de un siglo de literatura publicada. Esto suena grande. Según los estándares del deep learning, es modesto.
Para ponerlo en contexto, GPT-3 se entrenó con aproximadamente 45 terabytes de texto. La totalidad de Reaxys en formato estructurado de reacciones ocupa una fracción de ese volumen y, de forma crítica, es mucho menos uniforme en calidad.
Tabla 1. Principales bases de datos químicas usadas en el entrenamiento de modelos de IA y sus limitaciones conocidas.
Un análisis histórico de 2019 en Nature Communications (Schwaller et al.) demostraron que modelos basados en transformers entrenados con datos de USPTO podían predecir productos de reacción con aproximadamente un 90% de precisión top-1. Pero esos mismos modelos fallaron de forma considerable cuando se probaron con reacciones de clases químicas poco representadas — precisamente los andamios novedosos que los químicos medicinales más necesitan explorar.
Los tres problemas de datos centrales
1. El problema del sesgo de publicación: solo los éxitos llegan a imprimirse
La ciencia publica lo que funciona. Una reacción que falló 47 veces antes de tener éxito en el intento 48 suele reportarse en la literatura como una transformación limpia y de alto rendimiento.
Datos de reacciones negativas — condiciones fallidas, rendimientos colapsados, subproductos inesperados — se excluyen sistemáticamente de la literatura publicada. Sin embargo, esta información es precisamente lo que los modelos de planificación de síntesis con IA necesitan para aprender los límites de decisión.
Un estudio de 2021 en Science (Coley et al., MIT) encontró que los modelos entrenados exclusivamente con reacciones “exitosas” sobreestimaban la viabilidad de reacciones que involucran sustratos estéricamente impedidos en un 30–40%.
2. El problema de representación: el espacio químico está mal muestreado
Se estima que el universo químico de moléculas con características de fármacos contiene 10^60 compuestos (Bohacek et al., Med. Res. Rev., 1996). Las bases de datos actuales cubren quizá 10^8 compuestos conocidos — una fracción ínfima.
Más críticamente, lo que se ha sintetizado refleja prioridades históricas: la química medicinal del siglo XX favoreció en gran medida un conjunto estrecho de reacciones (acoplamiento amida, aminación reductiva, acoplamiento Suzuki, aminación Buchwald-Hartwig) que en conjunto representan una proporción desproporcionada de la literatura sobre síntesis de fármacos.
Un análisis de 2022 en Journal of Medicinal Chemistry (Brown & Boström) encontró que solo 10 tipos de reacción representan aproximadamente el 67% de los pasos de formación de enlaces en síntesis de fármacos publicadas. Los modelos de IA entrenados en este corpus están, por consiguiente, sesgados a recomendar esas mismas transformaciones — incluso cuando rutas más creativas producirían mejores propiedades moleculares.
Tabla 2. Frecuencia de tipos de reacciones en la literatura de química medicinal (adaptado de Brown & Boström, J. Med. Chem., 2022).
Esto crea un circuito de retroalimentación: la IA recomienda reacciones familiares, los químicos las ejecutan, la literatura las registra y la IA se entrena con ellas.
3. El problema de la calidad de la anotación: basura entra, basura sale
Incluso cuando existen datos de reacciones, su legibilidad por máquina suele ser deficiente. Un estudio de referencia de 2020 en ACS Central Science (Schwaller et al.) encontró que más del 20% de las reacciones extraídas de bases de datos de patentes contenían errores en el mapeo de átomos — lo que significa que la IA no podía aprender correctamente qué átomos de los reactivos se convertían en qué átomos de los productos.
La nomenclatura de disolventes inconsistente, la estequiometría faltante, la ausencia de datos de temperatura y las descripciones de reactivos no estandarizadas agravan el problema. Una reacción realizada a "room temperature" en un laboratorio de Florida y a "room temperature" en una instalación del norte de Europa puede implicar una diferencia de 10–15°C — una diferencia que puede ser significativa para transformaciones sensibles.
Retrosíntesis con IA: donde el cuello de botella muerde más fuerte
IA aplicada a la retrosíntesis — incluidas IBM RXN for Chemistry, REINVENT de AstraZeneca y la plataforma de Recursion — han demostrado utilidad genuina para el espacio químico bien precedented. El desafío surge en la frontera.
Un estudio de evaluación comparativa de 2023 en Nature Machine Intelligence (Tu & Coley) comparó cinco plataformas líderes de retrosíntesis con químicos expertos en un conjunto de prueba diverso de 100 moléculas objetivo. Hallazgos clave:
- Para moléculas con alta similitud estructural con los datos de entrenamiento (coeficiente de Tanimoto > 0.6): la IA igualó a los químicos expertos en calidad de ruta en el 71% de los casos.
- Para andamios novedosos (Tanimoto < 0.3): el rendimiento de la IA cayó a un 34% de coincidencia en la calidad de la ruta.
- Los químicos expertos mantuvieron aproximadamente un 68% de calidad para andamios novedosos — lo que demuestra que la brecha de datos perjudica desproporcionadamente a la IA en comparación con la pericia humana para objetivos novedosos.
La implicación para el descubrimiento de fármacos es directa: la IA en síntesis es más útil cuando menos se la necesita (para el espacio químico conocido) y menos útil cuando más se la necesita (para objetivos novedosos y de primera clase).
Plataformas como Schrödinger y Recursion ya operan en el límite de este mismo problema de datos en oncología.
→ Leer: Las principales plataformas de IA en química que transforman las moléculas pequeñas en oncología en 2026
El problema de los datos de ensayos: conectar estructura con actividad
Más allá de la predicción de síntesis, el diseño de fármacos impulsado por IA depende de datos de relaciones estructura-actividad (SAR) de alta calidad. Aquí, el cuello de botella de datos toma una forma diferente pero igualmente grave.
Las campañas de cribado de alto rendimiento generan millones de puntos de datos, pero abrumadoramente prueban compuestos en ensayos bioquímicos que pueden no reflejar la biología celular o in vivo. Un estudio de 2022 en PLOS Computational Biology estimó que menos del 15% de los valores de IC50 publicados son reproducibles entre laboratorios independientes, debido a la variabilidad de los ensayos, la deriva de las líneas celulares y el manejo inconsistente de compuestos.
IA generativa y el riesgo de alucinación
La IA generativa en la industria farmacéutica introduce un problema de datos distinto: los modelos pueden proponer moléculas que son sintéticamente inaccesibles, a pesar de parecer químicamente razonables sobre el papel.
Los grandes modelos de lenguaje y las redes neuronales de grafos entrenadas con cadenas SMILES pueden generar estructuras moleculares nuevas — pero sin restricciones estrictas derivadas de datos de viabilidad sintética, con frecuencia proponen rutas que violan la lógica química básica o requieren reactivos que no existen comercialmente.
Esto no es un fallo del algoritmo — es un fallo de los datos de entrenamiento para codificar suficientemente las restricciones sintéticas.
Lo que hacen las mejores organizaciones: soluciones emergentes
Aprendizaje federado y compartición de datos precompetitiva
La Pistoia Alliance y la consorcio MELLODDY (un consorcio de 10 empresas que incluye a Novartis, Janssen y Bayer) han sido pioneros en aprendizaje automático en química enfoques que permiten entrenar modelos sobre conjuntos de datos propietarios sin exponer los datos en bruto. Un artículo de 2021 en Nature Inteligencia de máquina informó que los modelos federados superaron a los modelos de una sola empresa en el 57% de las tareas de predicción.
Experimentación de alto rendimiento (HTE) como generadora de datos
Pfizer, Merck y AstraZeneca han publicado sobre el uso de plataformas de experimentación de alto rendimiento para generar sistemáticamente datos de condiciones de reacción —incluidas condiciones fallidas— a escala. Esto crea conjuntos de datos curados e internamente coherentes que evitan el sesgo de publicación de la literatura.
Predicción de condiciones de reacción y cuantificación de incertidumbre
Grupos del MIT (laboratorio Coley) y de ETH Zurich (grupo Reymond) están desarrollando modelos que no solo predicen rutas de síntesis sino que también cuantifican la incertidumbre —señalando cuando un paso propuesto está muy fuera de la distribución de entrenamiento. Esta capacidad de "saber lo que no sabes" se considera cada vez más esencial para el despliegue responsable de herramientas de planificación de síntesis con IA.
Mejorar la infraestructura de datos es la solución.
Si realmente mueve la aguja del ROI es la pregunta más difícil y aún sin respuesta.
→ Leer: Cuantificando el ROI: ¿las plataformas de química con IA realmente reducen los costes de I+D farmacéutica?
Un marco de calidad de datos para líderes farmacéuticos
Tabla 3. Dimensiones del marco de calidad de datos para la preparación de IA en I+D de pequeñas moléculas.
El camino por delante: cerrando la brecha
El cuello de botella de datos en la síntesis de pequeñas moléculas por IA es un problema resoluble — pero no será resuelto por ninguna empresa, algoritmo o iniciativa de base de datos por sí sola. Requiere un esfuerzo coordinado entre la academia, la industria y los organismos reguladores para establecer estándares de captura de datos, incentivar el intercambio de datos negativos y desplegar experimentación de alto rendimiento a una escala significativa.
Las organizaciones que inviertan ahora en infraestructura de datos — estandarizando ELNs, generando conjuntos de datos HTE y participando en consorcios precompetitivos — tendrán una ventaja competitiva duradera a medida que la I+D farmacéutica con IA madure. Quienes esperen a que los modelos mejoren sin abordar los datos subyacentes se encontrarán entrenando algoritmos sofisticados sobre el mismo sustrato empobrecido.
El modelo está listo para aprender. La pregunta es si estamos listos para enseñarle correctamente.
Preguntas frecuentes
P1. ¿Puede la IA actualmente reemplazar a los químicos medicinales en la planificación de síntesis?
No. Las actuales herramientas de planificación de síntesis con IA aumentan las capacidades de los químicos en reacciones bien documentadas, pero sistemáticamente rinden por debajo de los expertos humanos en espacios químicos novedosos. El cuello de botella de datos es la razón principal. La IA debe entenderse mejor como un copiloto poderoso, no como un navegador autónomo.
P2. ¿Es la falta de datos de reacciones negativas la limitación más grande?
Está entre las más impactantes, pero no es la única. La cobertura limitada del espacio químico, las inconsistencias en las anotaciones y la desconexión entre datos de ensayos in vitro y la biología in vivo son desafíos igualmente significativos para la IA en el descubrimiento de fármacos.
P3. ¿Cómo están abordando la escasez de datos los enfoques de aprendizaje federado?
El aprendizaje federado permite a múltiples organizaciones entrenar colaborativamente modelos de machine learning en química sin compartir datos propietarios en bruto. El consorcio MELLODDY demostró mejoras medibles en el rendimiento de los modelos usando este enfoque, aunque persisten barreras técnicas y de gobernanza significativas.
P4. ¿Qué papel juega la experimentación de alto rendimiento en la resolución del problema de datos?
Las plataformas HTE pueden generar miles de puntos de datos por semana bajo condiciones controladas y consistentes — incluyendo condiciones variadas sistemáticamente que fallan. Esto aborda directamente tanto el volumen como las brechas de datos negativos, convirtiéndola en una de las inversiones de mayor ROI que una organización de I+D farmacéutica puede hacer en apoyo del diseño de fármacos impulsado por IA.
P5. ¿Cómo deberían los líderes farmacéuticos priorizar las inversiones en datos para la preparación de IA?
Priorizar en este orden: (1) estandarización de datos de ELN y captura legible por máquina de los datos experimentales internos, (2) programas HTE para la generación sistemática de datos sobre condiciones de reacción, (3) consorcios de intercambio de datos precompetitivos para áreas de interés mutuo no competitivo, (4) inversión en arquitecturas de IA que cuantifiquen la incertidumbre y comuniquen la confianza del modelo.

Reporting on the science, business and regulation shaping the pharmaceutical industry.
Más en Fabricación farmacéutica
Todos los artículos →
Cumplimiento en la Fabricación Farmacéutica 2025: Reglamentos Clave y Mejores Prácticas que Debe Conocer

Mejora de la flexibilidad en la fabricación farmacéutica: fabricación ágil y escalado rápido

Discussion