En resumen: la IA generativa acelera principalmente el descubrimiento temprano de fármacos mediante la generación de moléculas candidatas o secuencias de proteínas, la propuesta de rutas de síntesis y la presentación de hipótesis comprobables, lo que permite a los equipos realizar menos experimentos a ciegas. Su rendimiento es óptimo cuando se imponen restricciones estrictas y se validan los resultados; si se la trata como a un oráculo, puede inducir a error con total seguridad.
Conclusiones clave:
Aceleración: utilice GenAI para ampliar la generación de ideas y luego restringirla con un filtrado riguroso.
Restricciones: Requerir rangos de propiedades, reglas de andamiaje y límites de novedad antes de la generación.
Validación: Tratar los resultados como hipótesis; confirmar con ensayos y modelos ortogonales.
Trazabilidad: registre las indicaciones, los resultados y la justificación para que las decisiones sigan siendo auditables y revisables.
Resistencia al mal uso: evite fugas y exceso de confianza con gobernanza, controles de acceso y revisión humana.

Artículos que quizás te interese leer después de éste:
🔗 El papel de la IA en la atención sanitaria
Cómo la IA mejora el diagnóstico, los flujos de trabajo, la atención al paciente y los resultados.
🔗 ¿Reemplazará la IA a los radiólogos?
Explora cómo la automatización mejora la radiología y qué sigue siendo humano.
🔗 ¿Reemplazará la IA a los médicos?
Una mirada honesta al impacto de la IA en el trabajo y la práctica médica.
🔗 Las mejores herramientas de laboratorio de IA para el descubrimiento científico
Las mejores herramientas de laboratorio de IA para acelerar los experimentos, el análisis y el descubrimiento.
El papel de la IA generativa en el descubrimiento de fármacos, en un solo resumen 😮💨
La IA generativa ayuda a los equipos de investigación farmacéutica a crear moléculas candidatas, predecir propiedades, sugerir modificaciones, proponer rutas de síntesis, explorar hipótesis biológicas y acortar los ciclos de iteración, especialmente en las primeras etapas del descubrimiento y la optimización de compuestos líderes. Nature 2023 (revisión sobre el descubrimiento de ligandos) Elsevier 2024 (revisión sobre modelos generativos en el diseño de fármacos de novo)
Y sí, también puede generar disparates con total seguridad. Es parte del trato. Como un becario muy entusiasta con un motor de cohete. Guía para clínicos (riesgo de alucinaciones) npj Digital Medicine 2025 (alucinaciones + marco de seguridad)
Por qué esto importa más de lo que la gente admite 💥
Gran parte del trabajo de descubrimiento consiste en "buscar". Buscar en el espacio químico, en la biología, en la literatura, en las relaciones estructura-función. El problema es que el espacio químico es... prácticamente infinito. Accounts of Chemical Research 2015 (espacio químico) Irwin & Shoichet 2009 (escala del espacio químico)
Podrías pasar varias vidas simplemente probando variaciones “razonables”.
La IA generativa cambia el flujo de trabajo de:
-
“Probemos lo que se nos ocurre”
a:
-
“Generemos un conjunto de opciones más grande e inteligente y luego probemos las mejores”
No se trata de eliminar experimentos, sino de elegir mejores experimentos. 🧠 Nature 2023 (revisión del descubrimiento de ligandos)
Además, y esto se suele comentar poco, facilita la comunicación entre equipos de diferentes disciplinas. Químicos, biólogos, especialistas en DMPK, científicos computacionales… todos tienen modelos mentales distintos. Un buen sistema generativo puede servir como un bloc de notas compartido. Reseña de Frontiers in Drug Discovery 2024.
¿Qué hace que una versión de IA generativa sea buena para el descubrimiento de fármacos? ✅
No todas las IA generativas son iguales. Una buena versión en este ámbito se centra menos en demostraciones llamativas y más en una fiabilidad discreta (y aquí, la discreción es una virtud). Nature 2023 (revisión del descubrimiento de ligandos).
Una buena configuración de IA generativa normalmente tiene:
-
Fundamentación en el dominio: entrenado o adaptado a datos químicos, biológicos y farmacológicos (no solo texto genérico) 🧬 Revisión de Elsevier 2024 (modelos generativos)
-
Restricciones de primera generación: puede obedecer reglas como rangos de lipofilicidad, restricciones de andamiaje, características del sitio de unión, objetivos de selectividad JCIM 2024 (modelos de difusión en el diseño de fármacos de novo) REINVENT 4 (marco abierto)
-
Conocimiento de las propiedades: genera moléculas que no solo son novedosas, sino también "no ridículas" en términos de ADMET. ADMETlab 2.0 (por qué importa el ADMET temprano).
-
Informes de incertidumbre: indican cuándo se trata de una suposición y cuándo es una información sólida (incluso un intervalo de confianza aproximado ayuda). Principios de validación QSAR de la OCDE (ámbito de aplicabilidad).
-
Controles humanos en el circuito: los químicos pueden dirigir, rechazar y guiar los resultados rápidamente Nature 2023 (flujo de trabajo + contexto tecnológico de descubrimiento)
-
Trazabilidad: puedes ver por qué se produjo una sugerencia (al menos parcialmente), o estás trabajando a ciegas. Guía QSAR de la OCDE (transparencia del modelo + validación).
-
Sistema de evaluación: acoplamiento molecular, QSAR, filtros, comprobaciones de retrosíntesis: todo integrado 🔧 Nature 2023 (revisión del descubrimiento de ligandos) Aprendizaje automático en CASP (Coley 2018)
-
Controles de sesgo y fugas: para evitar que la memorización de datos de entrenamiento se cuele (sí, sucede) USENIX 2021 (extracción de datos de entrenamiento) Vogt 2023 (preocupaciones sobre novedad/singularidad)
Si tu IA generativa no puede manejar las restricciones, es básicamente un generador de novedades. Diversión en fiestas. Menos diversión en un programa de drogas.
Dónde encaja la IA generativa en el proceso de descubrimiento de fármacos 🧭
Aquí tienes un mapa mental sencillo. La IA generativa puede contribuir a casi todas las etapas, pero rinde mejor cuando la iteración es costosa y el espacio de hipótesis es enorme. Nature 2023 (revisión del descubrimiento de ligandos).
Puntos de contacto comunes:
-
Descubrimiento y validación de objetivos (hipótesis, mapeo de vías, sugerencias de biomarcadores) Revisión de Frontiers in Drug Discovery 2024
-
Identificación de aciertos (aumento del cribado virtual, generación de aciertos de novo) Nature Biotechnology 2019 (GENTRL)
-
Optimización de clientes potenciales (sugerencia de análogos, ajuste de múltiples parámetros) REINVENT 4
-
Soporte preclínico (predicción de propiedades ADMET, sugerencias de formulación a veces) ADMETlab 2.0
-
Planificación de CMC y síntesis (sugerencias de retrosíntesis, priorización de rutas) AiZynthFinder 2020 Coley 2017 (retrosíntesis asistida por computadora)
-
Trabajo de conocimiento (síntesis de literatura, resúmenes del panorama competitivo) 📚 Patrones 2025 (Másteres en Derecho (LLM) en descubrimiento de fármacos)
En muchos programas, los mayores logros provienen de la integración del flujo de trabajo, no de un único modelo que sea "genial". El modelo es el motor; el proceso es el vehículo. Nature 2023 (revisión del descubrimiento de ligandos).
Tabla comparativa: enfoques populares de IA generativa utilizados en el descubrimiento de fármacos 📊
Una mesa un poco imperfecta, porque la vida real es un poco imperfecta.
| Herramienta/Enfoque | Mejor para (audiencia) | Precio-ish | Por qué funciona (y cuándo no) |
|---|---|---|---|
| Generadores de moléculas de novo (SMILES, gráficos) | Química médica + química comp | $$-$$$ | Excelente para explorar nuevos análogos rápidamente 😎, pero puede generar compuestos inestables y desequilibrados. REINVENT 4 GENTRL (Nature Biotech 2019) |
| Generadores de proteínas/estructuras | Equipos de biología, biología estructural | $$$ | Ayuda a proponer secuencias y estructuras, pero "parecer plausible" no es lo mismo que "funcionar". AlphaFold (Nature 2021) RFdiffusion (Nature 2023) |
| Diseño molecular de estilo de difusión | Equipos de ML avanzado | $$-$$$$ | Fuerte en el condicionamiento de restricciones y la diversidad: la configuración puede ser... todo un asunto JCIM 2024 (modelos de difusión) PMC 2025 revisión de difusión |
| Copilotos de predicción de propiedades (combinación QSAR + GenAI) | DMPK, equipos de proyecto | $$ | Bueno para la clasificación y el triaje; malo si se toma como verdad absoluta 😬 OCDE (ámbito de aplicabilidad) ADMETlab 2.0 |
| Planificadores de retrosíntesis | Química de procesos, CMC | $$-$$$ | Acelera la ideación de rutas, pero aún requiere la intervención humana para la viabilidad y la seguridad. AiZynthFinder 2020 Coley 2018 (CASP) |
| Copilotos de laboratorio multimodales (texto + datos de ensayo) | Equipos de traducción | $$$ | Útil para extraer señales de diferentes conjuntos de datos; propenso a un exceso de confianza si los datos son irregulares. Nature 2024 (efectos de lote en imágenes celulares) npj Digital Medicine 2025 (multimodal en biotecnología) |
| Asistentes de literatura e hipótesis | Todo el mundo, en la práctica | $ | Reduce mucho el tiempo de lectura, pero las alucinaciones pueden ser escurridizas, como calcetines que desaparecen. Patrones 2025 (Másteres en Derecho en el descubrimiento de fármacos). Guía para clínicos (alucinaciones). |
| Modelos de cimentación internos personalizados | Grandes farmacéuticas y biotecnológicas bien financiadas | $$$$ | Máximo control e integración, aunque también costoso y lento de construir (lo siento, es cierto). Reseña de Frontiers in Drug Discovery 2024. |
Notas: los precios varían enormemente según la escala, el cómputo, la licencia y si su equipo prefiere "conectar y usar" o "construyamos una nave espacial"
Una mirada más de cerca: IA generativa para el descubrimiento de éxitos y el diseño de novo 🧩
Este es el caso de uso principal: generar moléculas candidatas desde cero (o a partir de un andamio) que coincidan con un perfil objetivo. Nature Biotechnology 2019 (GENTRL) REINVENT 4
Cómo funciona normalmente en la práctica:
-
Definir restricciones
-
Clase objetivo, forma del bolsillo de unión, ligandos conocidos
-
rangos de propiedades (solubilidad, logP, PSA, etc.) Lipinski (contexto de la regla de 5)
-
Restricciones de novedad (evitar zonas de propiedad intelectual conocidas) 🧠 Vogt 2023 (evaluación de la novedad)
-
-
Generar candidatos
-
salto de andamio
-
crecimiento de fragmentos
-
Sugerencias para “decorar este núcleo”
-
Generación multiobjetivo (unión + permeabilidad + no toxicidad relativa) REINVENT 4 Elsevier 2024 (modelos generativos)
-
-
Filtrar agresivamente
-
reglas de la química medicinal
-
PAINS y filtros de grupo reactivos Baell & Holloway 2010 (PAINS)
-
Comprobaciones de sintetizabilidad AiZynthFinder 2020
-
acoplamiento/puntuación (imperfecto pero útil) Nature 2023 (revisión del descubrimiento de ligandos)
-
-
Seleccione un conjunto pequeño para la síntesis
-
Los humanos todavía escogen, porque a veces pueden oler tonterías
-
La incómoda verdad: el valor no reside simplemente en las "nuevas moléculas". Se trata de nuevas moléculas que se ajustan a las limitaciones de tu programa. Ese último punto lo es todo. Nature 2023 (revisión sobre el descubrimiento de ligandos)
Además, se me ocurre una ligera exageración: cuando se hace bien, puede parecer que has contratado a un equipo de químicos jóvenes incansables que nunca duermen ni se quejan. Por otro lado, tampoco entienden por qué una estrategia de protección específica es una pesadilla, así que… equilibrio 😅.
Una mirada más de cerca: Optimización de clientes potenciales con IA generativa (ajuste de múltiples parámetros) 🎛️
La optimización de clientes potenciales es donde los sueños se complican.
Quieres:
-
aumento de potencia
-
selectividad hacia arriba
-
estabilidad metabólica en aumento
-
solubilidad hacia arriba
-
señales de seguridad caídas
-
permeabilidad “justo la adecuada”
-
Y aún así ser sintetizable
Esto es optimización multiobjetivo clásica. La IA generativa es excepcionalmente buena proponiendo un conjunto de soluciones de compromiso en lugar de pretender que existe una solución perfecta. REINVENT 4, Elsevier, 2024 (modelos generativos).
Formas prácticas en que los equipos lo utilizan:
-
Sugerencia análoga: “Crea 30 variantes que reduzcan la eliminación pero mantengan la potencia”.
-
Escaneo de sustituyentes: exploración guiada en lugar de enumeración por fuerza bruta
-
Salto de andamio: cuando un núcleo choca contra una pared (toxicidad, IP o estabilidad)
-
Sugerencias explicativas: "Este grupo polar puede favorecer la solubilidad, pero podría perjudicar la permeabilidad" (no siempre es correcto, pero resulta útil).
Una advertencia: los predictores de propiedades pueden ser poco fiables. Si los datos de entrenamiento no coinciden con la serie química, el modelo puede estar completamente equivocado. De hecho, muy equivocado. Y no se inmutará. Principios de validación QSAR de la OCDE (dominio de aplicabilidad) Weaver 2008 (dominio de aplicabilidad QSAR)
Una mirada más de cerca: ADMET, toxicidad y la evaluación de “por favor, no maten el programa” 🧯
ADMET es donde muchos candidatos fracasan silenciosamente. La IA generativa no resuelve los problemas de la biología, pero puede reducir los errores evitables. ADMETlab 2.0 Waring 2015 (abandono)
Roles comunes:
-
Predicción de pasivos metabólicos (sitios de metabolismo, tendencias de depuración)
-
Señalización de posibles motivos de toxicidad (alertas, intermediarios reactivos)
-
Estimación de rangos de solubilidad y permeabilidad
-
Sugerencias de modificaciones para reducir el riesgo de hERG o mejorar la estabilidad 🧪 FDA (Preguntas y respuestas de ICH E14/S7B) EMA (Descripción general de ICH E14/S7B)
El patrón más efectivo tiende a verse así: utilizar GenAI para proponer opciones, pero utilizar modelos y experimentos especializados para verificar.
La IA generativa es el motor de la ideación. La validación aún reside en los ensayos.
Una mirada más de cerca: IA generativa para productos biológicos e ingeniería de proteínas 🧬✨
El descubrimiento de fármacos no se limita a las moléculas pequeñas. La IA generativa también se utiliza para:
-
generación de secuencias de anticuerpos
-
Sugerencias para la maduración de la afinidad
-
mejoras en la estabilidad de las proteínas
-
ingeniería enzimática
-
Exploración de terapias con péptidos ProteinMPNN (Science 2022) Rives 2021 (modelos de lenguaje de proteínas)
La generación de proteínas y secuencias puede ser muy potente porque el "lenguaje" de las secuencias se adapta sorprendentemente bien a los métodos de aprendizaje automático. Pero, en resumen: se adapta bien... hasta que deja de hacerlo. Porque la inmunogenicidad, la expresión, los patrones de glicosilación y las limitaciones de desarrollo pueden ser implacables. AlphaFold (Nature 2021) ProteinGenerator (Nat Biotech 2024)
Entonces, las mejores configuraciones incluyen:
-
filtros de desarrollo
-
puntuación del riesgo de inmunogenicidad
-
restricciones de fabricación
-
Bucles de laboratorio húmedo para una iteración rápida 🧫
Si te saltas estos, obtienes una secuencia magnífica que se comporta como una diva en producción.
Una mirada más de cerca: Planificación de síntesis y sugerencias de retrosíntesis 🧰
La IA generativa también se está infiltrando en las operaciones químicas, no solo en la ideación de moléculas.
Los planificadores de retrosíntesis pueden:
-
proponer rutas hacia un compuesto objetivo
-
Sugerir materiales de partida disponibles comercialmente
-
Clasificar las rutas por número de pasos o viabilidad percibida
-
Ayuda a los químicos a descartar rápidamente ideas "bonitas pero imposibles" AiZynthFinder 2020 Coley 2018 (CASP)
Esto puede ahorrar mucho tiempo, especialmente al explorar muchas estructuras candidatas. Aun así, las personas son muy importantes aquí porque:
-
cambios en la disponibilidad de reactivos
-
Las preocupaciones sobre seguridad y escala son reales
-
Algunos pasos parecen estar bien en el papel, pero fallan repetidamente
Una metáfora imperfecta, pero la usaré de todos modos: la IA de retrosíntesis es como un GPS que suele ser preciso, salvo que a veces te lleva a través de un lago e insiste en que es un atajo. 🚗🌊 Coley 2017 (retrosíntesis asistida por ordenador)
Datos, modelos multimodales y la cruda realidad de los laboratorios 🧾🧪
A la IA generativa le encantan los datos. Los laboratorios los producen. En teoría, parece sencillo.
Ja. No.
Los datos reales de laboratorio son:
-
incompleto
-
ruidoso
-
lleno de efectos de lote Leek et al. 2010 (efectos de lote) Nature 2024 (efectos de lote en imágenes celulares)
-
dispersos en distintos formatos
-
bendecidos con convenciones de nombres "creativas"
Los sistemas generativos multimodales pueden combinar:
-
resultados del ensayo
-
estructuras químicas
-
imágenes (microscopía, histología)
-
ómica (transcriptómica, proteómica)
-
Texto (protocolos, ELN, informes) npj Medicina Digital 2025 (multimodal en biotecnología) Análisis de Imágenes Médicas 2025 (IA multimodal en medicina)
Cuando funciona, es fantástico. Puedes descubrir patrones no obvios y proponer experimentos que un solo especialista podría pasar por alto.
Cuando falla, falla silenciosamente. No da un portazo. Simplemente te empuja hacia una conclusión errónea, aunque segura. Por eso, la gobernanza, la validación y la revisión del dominio no son opcionales. Guía para clínicos (alucinaciones) npj Digital Medicine 2025 (alucinaciones + marco de seguridad)
Riesgos, limitaciones y la sección “no te dejes engañar por la fluidez” ⚠️
Si solo recuerdas una cosa, recuerda esto: la IA generativa es persuasiva. Puede sonar acertada aun cuando esté equivocada. Guía para clínicos (alucinaciones)
Riesgos clave:
-
Mecanismos alucinados: biología plausible que no es real. Guía para clínicos (alucinaciones).
-
Fuga de datos: generación de algo demasiado similar a compuestos conocidos USENIX 2021 (extracción de datos de entrenamiento) Vogt 2023 (preocupaciones sobre novedad/singularidad)
-
Sobreoptimización: perseguir puntuaciones previstas que no se traducen in vitro Nature 2023 (revisión del descubrimiento de ligandos)
-
Sesgo: datos de entrenamiento sesgados hacia ciertos quimiotipos o objetivos Vogt 2023 (evaluación del modelo + sesgo/novedad)
-
Falsa novedad: moléculas “nuevas” que en realidad son variantes triviales (Vogt, 2023).
-
Brechas de explicabilidad: es difícil justificar decisiones ante las partes interesadas Principios de validación QSAR de la OCDE
-
Problemas de seguridad y propiedad intelectual: detalles confidenciales del programa en las indicaciones 😬 USENIX 2021 (extracción de datos de entrenamiento)
Mitigaciones que ayudan en la práctica:
-
Mantener a los humanos en el ciclo de decisiones
-
Registrar indicaciones y resultados para la trazabilidad
-
validar con métodos ortogonales (ensayos, modelos alternativos)
-
Aplicar restricciones y filtros automáticamente
-
Tratar los resultados como hipótesis, no como tablas de verdad. Guía QSAR de la OCDE.
La IA generativa es una herramienta poderosa. Las herramientas poderosas no te convierten en carpintero... solo te permiten cometer errores más rápido si no sabes lo que haces.
Cómo los equipos adoptan la IA generativa sin caos 🧩🛠️
Los equipos suelen querer usar esto sin convertir la organización en una feria de ciencias. Una estrategia práctica de adopción sería la siguiente:
-
Comience con un cuello de botella (expansión de aciertos, generación de análogos, triaje de literatura) Nature 2023 (revisión del descubrimiento de ligandos)
-
Construir un ciclo de evaluación riguroso (filtros + acoplamiento + comprobaciones de propiedades + revisión química) REINVENT 4 AiZynthFinder 2020
-
Medir resultados (tiempo ahorrado, tasa de aciertos, reducción de la deserción) Waring 2015 (deserción)
-
Integración con herramientas existentes (ELN, registro de compuestos, bases de datos de ensayos) Recurso ELN de Edimburgo
-
Crear reglas de uso (qué se puede solicitar, qué permanece sin conexión, pasos de revisión) USENIX 2021 (riesgo de extracción de datos)
-
Entrenar a las personas con delicadeza (en serio, la mayoría de los errores provienen del mal uso, no del modelo). Guía para clínicos (alucinaciones).
Además, no subestimes la cultura. Si los químicos sienten que se les impone la IA, la ignorarán. Si les ahorra tiempo y respeta su experiencia, la adoptarán rápidamente. Los humanos somos así de graciosos 🙂.
¿Cuál es el papel de la IA generativa en el descubrimiento de fármacos cuando se amplía el campo? 🔭
En perspectiva, el papel no es “reemplazar a los científicos”, sino “ampliar el alcance científico”. Nature 2023 (revisión del descubrimiento de ligandos).
Ayuda a los equipos a:
-
Explorar más hipótesis por semana
-
proponer más estructuras candidatas por ciclo
-
priorizar los experimentos de forma más inteligente
-
Comprimir los bucles de iteración entre el diseño y la prueba
-
Compartir conocimientos entre silos Patrones 2025 (LLM en descubrimiento de fármacos)
Y quizás lo más subestimado: ayuda a no desperdiciar la costosa creatividad humana en tareas repetitivas. La gente debería pensar en el mecanismo, la estrategia y la interpretación, no en pasar días generando manualmente listas de variantes. Nature 2023 (revisión del descubrimiento de ligandos).
Así que sí, el papel de la IA generativa en el descubrimiento de fármacos es un acelerador, un generador, un filtro y, a veces, un generador de problemas. Pero es valioso.
Resumen de cierre 🧾✅
La IA generativa se está convirtiendo en una capacidad fundamental en el descubrimiento de fármacos modernos, ya que puede generar moléculas, hipótesis, secuencias y rutas más rápidamente que los humanos, y puede ayudar a los equipos a elegir mejores experimentos. ( Revisión de Frontiers in Drug Discovery 2024 ; Nature 2023, revisión sobre el descubrimiento de ligandos).
Viñetas del resumen:
-
Es ideal para de descubrimiento temprano y optimización de clientes potenciales ⚙️ REINVENT 4
-
Es compatible con moléculas pequeñas y productos biológicos GENTRL (Nature Biotech 2019) ProteinMPNN (Science 2022)
-
Aumenta la productividad al ampliar el embudo de ideas Nature 2023 (revisión del descubrimiento de ligandos)
-
Necesita restricciones, validación y humanos para evitar tonterías confiadas Principios QSAR de la OCDE Guía para clínicos (alucinaciones)
-
Los mayores logros provienen de la integración del flujo de trabajo, no de la espuma del marketing Nature 2023 (revisión del descubrimiento de ligandos)
Si lo tratas como a un colaborador, no como a un oráculo, realmente puede impulsar los programas. Y si lo tratas como a un oráculo… bueno, puede que acabes siguiendo ese GPS hasta el lago otra vez.
Ejemplo práctico: Creación de un flujo de trabajo de generación de moléculas basado en restricciones 🧪
Guión
Un pequeño equipo de biotecnología, ficticio pero realista, trabaja en una diana para una enfermedad inflamatoria. Ya cuentan con 42 compuestos prometedores, aunque poco prometedores, tras un proceso de cribado, pero la mayoría tienen una solubilidad deficiente y algunos se encuentran demasiado cerca del espacio patentado por la competencia.
En lugar de pedirle a un modelo generativo que "encuentre mejores moléculas" —lo cual es básicamente una invitación a recibir un sinsentido elegante—, el equipo crea un flujo de trabajo riguroso para la expansión de los resultados positivos.
El objetivo es sencillo: generar un conjunto más amplio de análogos, filtrarlos rigurosamente y enviar solo los candidatos más defendibles a la revisión de química medicinal.
Lo que necesita el asistente
El equipo proporciona al sistema:
Perfil del objetivo e información sobre el ligando conocido
las 42 estructuras de impacto confirmadas
límites de propiedades para peso molecular, logP, TPSA, solubilidad y aclaramiento previsto
Estructuras bloqueadas y umbrales de similitud para evitar la propiedad intelectual
Dolores y filtros de grupo reactivos Baell y Holloway 2010
Verificaciones de predicción ADMET ADMETlab 2.0
Comprobaciones de viabilidad de la retrosíntesis con AiZynthFinder 2020
Reglas de revisión humana para la selección final
Lo importante es que el modelo no puede optimizar la potencia por sí solo. Debe equilibrar la potencia, la novedad, la capacidad de desarrollo y la capacidad de síntesis.
Ejemplo de instrucciones
Genera 150 ideas análogas basadas en estas estructuras de éxito confirmadas. Mantén el peso molecular entre 300 y 480, el logP predicho entre 1,5 y 4,0, el TPSA por debajo de 110 y evita los andamios bloqueados que figuran en el archivo IP. Prioriza las estructuras sin alertas PAINS, sin grupos reactivos obvios y con una ruta de síntesis plausible de cinco pasos o menos. Para cada molécula, explica la modificación principal, la mejora de la propiedad prevista, el riesgo clave y si el compuesto debe rechazarse, revisarse o priorizarse.
Cómo probarlo
El equipo no confía en el primer resultado. Ejecutan un pequeño ciclo de evaluación:
Compruebe si las moléculas generadas cumplen las restricciones de propiedades
Elimine los compuestos casi idénticos y las estructuras demasiado parecidas a compuestos conocidos
Ejecutar filtros de PAINS, grupo reactivo y química medicinal básica
Ejecute un segundo modelo de propiedad para comparar las predicciones de ADMET
Pida a dos químicos que califiquen de forma independiente a los 30 mejores candidatos
Enviar solo la lista de candidatos con mayor puntuación a la discusión de síntesis
Una pregunta de prueba valiosa es: "¿Seguiríamos considerando esta molécula si la IA no la hubiera sugerido?"
Cuando la respuesta es no, el equipo pregunta por qué. A veces, eso revela una buena idea nueva. Otras veces, revela ilusiones basadas en modelos preestablecidos.
Resultado
Resultado ilustrativo únicamente; no se trata de un caso práctico real de una empresa.
Según los tiempos de ejecución de tres tareas de expansión de muestras, el flujo de trabajo manual tardó aproximadamente 5 horas en crear y clasificar 60 ideas análogas. El flujo de trabajo GenAI, que prioriza las restricciones, produjo 150 candidatos iniciales en aproximadamente 55 minutos.
Tras el filtrado, solo 27 candidatos superaron la evaluación completa. De ellos, los químicos calificaron 9 como dignos de un análisis más profundo, 12 como "interesantes pero arriesgados" y 6 como rechazados tras la revisión.
Esto significa que el resultado valioso no fueron "150 moléculas nuevas". El resultado valioso fueron 9 candidatos evaluables en menos de una hora, con un registro de auditoría claro que muestra qué restricciones superó o no cada candidato.
Un equipo podría verificar esto mediante el seguimiento:
tiempo invertido por ciclo de diseño
número de estructuras generadas
porcentaje eliminado por los filtros
tasa de aceptación de químicos
Número de candidatos seleccionados para la síntesis
Número confirmado posteriormente como activo en el ensayo
¿Qué puede salir mal?
Es posible que el modelo optimice los filtros en lugar de proponer una química realmente sólida.
Un candidato puede parecer excelente en las pruebas ADMET previstas, pero fallar inmediatamente en un ensayo real. Principios de validación QSAR de la OCDE
Las propuestas de retrosíntesis pueden parecer plausibles, pero dependen de reactivos no disponibles, condiciones incómodas o una química insegura.
El filtro de novedad puede eliminar compuestos valiosos de forma demasiado agresiva, o dejar pasar moléculas que aún están demasiado cerca de propiedades intelectuales conocidas.
El mayor error es tomar la lista clasificada como la verdad absoluta. Es solo una lista de hipótesis priorizadas.
Información práctica para llevar
La mejor aplicación de la IA generativa en el descubrimiento de fármacos no consiste en "pulsar un botón y obtener el fármaco". Se trata de una fábrica de ideas controlada: generar ideas de forma generalizada, filtrarlas rigurosamente, documentar cada decisión y dejar que los científicos tomen la decisión final.
Preguntas frecuentes
¿Cuál es el papel de la IA generativa en el descubrimiento de fármacos?
La IA generativa amplía principalmente el embudo de ideas en el descubrimiento temprano y la optimización de clientes potenciales, proponiendo moléculas candidatas, secuencias de proteínas, rutas de síntesis e hipótesis biológicas. El valor reside menos en "reemplazar experimentos" y más en "elegir mejores experimentos" mediante la generación de múltiples opciones y un filtrado riguroso. Funciona mejor como acelerador dentro de un flujo de trabajo disciplinado, no como un factor de toma de decisiones independiente.
¿En qué áreas del proceso de descubrimiento de fármacos funciona mejor la IA generativa?
Suele ofrecer el mayor valor donde el espacio de hipótesis es amplio y la iteración costosa, como en la identificación de aciertos, el diseño de novo y la optimización de clientes potenciales. Los equipos también lo utilizan para la clasificación ADMET, sugerencias de retrosíntesis y el respaldo de la literatura o hipótesis. Las mayores ventajas suelen provenir de la integración de la generación con filtros, puntuación y revisión humana, en lugar de esperar que un solo modelo sea "inteligente"
¿Cómo se establecen restricciones para que los modelos generativos no produzcan moléculas inútiles?
Un enfoque práctico consiste en definir restricciones antes de la generación: rangos de propiedades (como solubilidad u objetivos logP), reglas de andamiaje o subestructura, características del sitio de unión y límites de novedad. Posteriormente, se aplican filtros de química medicinal (incluidos PAINS/grupos reactivos) y comprobaciones de sintetizabilidad. La generación con restricciones previas es especialmente útil con el diseño molecular de difusión y marcos como REINVENT 4, donde se pueden codificar objetivos multiobjetivo.
¿Cómo deben los equipos validar los resultados de GenAI para evitar alucinaciones y exceso de confianza?
Trate cada resultado como una hipótesis, no como una conclusión, y valídelo con ensayos y modelos ortogonales. Combine la generación con un filtrado, acoplamiento o puntuación agresivos cuando corresponda, y con comprobaciones del dominio de aplicabilidad para predictores tipo QSAR. Haga visible la incertidumbre siempre que sea posible, ya que los modelos pueden estar seguros de estar equivocados en cuanto a química fuera de distribución o afirmaciones biológicas dudosas. La revisión humana en el circuito sigue siendo una medida de seguridad fundamental.
¿Cómo se puede evitar la fuga de datos, el riesgo de IP y los resultados “memorizados”?
Utilice controles de gobernanza y acceso para evitar que los detalles sensibles del programa se incluyan de forma casual en las solicitudes, y registre las solicitudes y los resultados para su auditabilidad. Aplique comprobaciones de novedad y similitud para que los candidatos generados no se acerquen demasiado a compuestos conocidos o regiones protegidas. Mantenga reglas claras sobre qué datos se permiten en sistemas externos y prefiera entornos controlados para trabajos de alta sensibilidad. La revisión humana ayuda a detectar sugerencias demasiado familiares con antelación.
¿Cómo se utiliza la IA generativa para la optimización de clientes potenciales y el ajuste de múltiples parámetros?
En la optimización de leads, la IA generativa es valiosa porque permite proponer múltiples soluciones de compromiso en lugar de buscar un único compuesto "perfecto". Los flujos de trabajo comunes incluyen la sugerencia de análogos, el escaneo guiado de sustituyentes y el salto de andamios cuando las restricciones de potencia, toxicidad o IP impiden el progreso. Los predictores de propiedades pueden ser frágiles, por lo que los equipos suelen clasificar los candidatos con múltiples modelos y luego confirmar las mejores opciones experimentalmente.
¿Puede la IA generativa ayudar también con la ingeniería biológica y de proteínas?
Sí, los equipos lo utilizan para la generación de secuencias de anticuerpos, ideas sobre la maduración de la afinidad, mejoras de estabilidad y exploración de enzimas o péptidos. La generación de proteínas/secuencias puede parecer plausible sin ser desarrollable, por lo que es importante aplicar filtros de desarrollabilidad, inmunogenicidad y fabricabilidad. Herramientas estructurales como AlphaFold pueden facilitar el razonamiento, pero una "estructura plausible" no constituye una prueba de expresión, función ni seguridad. Los circuitos de laboratorio siguen siendo esenciales.
¿Cómo apoya la IA generativa la planificación de la síntesis y la retrosíntesis?
Los planificadores de retrosíntesis pueden sugerir rutas, materiales de partida y clasificaciones de rutas para acelerar la ideación y descartar rápidamente rutas inviables. Herramientas y enfoques como la planificación tipo AiZynthFinder son más eficaces cuando se combinan con comprobaciones de viabilidad reales realizadas por químicos. La disponibilidad, la seguridad, las limitaciones de escalado y las reacciones en papel que fallan en la práctica aún requieren criterio humano. De esta manera, se ahorra tiempo sin pretender que la química esté resuelta.
Referencias
-
Nature - Análisis del descubrimiento de ligandos (2023) - nature.com
-
Biotecnología de la naturaleza - GENTRL (2019) - nature.com
-
Naturaleza - AlphaFold (2021) - nature.com
-
Naturaleza - RFdiffusion (2023) - nature.com
-
Nature Biotechnology - Generador de proteínas (2024) - nature.com
-
Nature Communications - Efectos de lote en la imagen celular (2024) - nature.com
-
Medicina Digital npj - Alucinaciones y marco de seguridad (2025) - nature.com
-
Medicina Digital npj - Multimodal en biotecnología (2025) - nature.com
-
Ciencia - ProteinMPNN (2022) - science.org
-
Patrones Celulares - LLM en descubrimiento de fármacos (2025) - cell.com
-
ScienceDirect (Elsevier) - Modelos generativos en el diseño de fármacos de novo (2024) - sciencedirect.com
-
ScienceDirect (Elsevier) - Vogt (2023): inquietudes sobre la novedad y la singularidad - sciencedirect.com
-
Análisis de imágenes médicas (ScienceDirect) : IA multimodal en medicina (2025) - sciencedirect.com
-
PubMed Central - Guía para clínicos (riesgo de alucinaciones) - nih.gov
-
Cuentas de investigación química (Publicaciones de la ACS) - Espacio químico (2015) - acs.org
-
PubMed Central - Irwin y Shoichet (2009): escala del espacio químico - nih.gov
-
Fronteras en el descubrimiento de fármacos (PubMed Central) - Revisión (2024) - nih.gov
-
Revista de Información y Modelado Químico (Publicaciones ACS) - Modelos de difusión en el diseño de fármacos de novo (2024) - acs.org
-
PubMed Central - REINVENT 4 (marco abierto) - nih.gov
-
PubMed Central - ADMETlab 2.0 (los primeros ADMET son importantes) - nih.gov
-
OCDE - Principios para la validación con fines regulatorios de los modelos (Q)SAR - oecd.org
-
OCDE - Documento de orientación sobre la validación de modelos (Q)SAR - oecd.org
-
Cuentas de investigación química (Publicaciones de la ACS) - Planificación de síntesis asistida por computadora / CASP (Coley, 2018) - acs.org
-
ACS Central Science (Publicaciones de la ACS) - Retrosíntesis asistida por computadora (Coley, 2017) - acs.org
-
PubMed Central - AiZynthFinder (2020) - nih.gov
-
PubMed - Lipinski: Contexto de la regla de 5 - nih.gov
-
Revista de Química Medicinal (Publicaciones de la ACS) - Baell y Holloway (2010): DOLOR - acs.org
-
PubMed - Waring (2015): deserción - nih.gov
-
PubMed - Rives (2021): modelos de lenguaje proteico - nih.gov
-
PubMed Central - Leek et al. (2010): efectos de lote - nih.gov
-
PubMed Central - Revisión de difusión (2025) - nih.gov
-
FDA - E14 y S7B: evaluación clínica y no clínica de la prolongación del intervalo QT/QTc y el potencial proarrítmico (Preguntas y respuestas) - fda.gov
-
Agencia Europea de Medicamentos - Resumen de la directriz E14/S7B de la ICH - europa.eu
-
USENIX - Carlini et al. (2021): extracción de datos de entrenamiento de modelos lingüísticos - usenix.org
-
Universidad de Edimburgo – Servicios de Investigación Digital - Recurso de cuaderno de laboratorio electrónico (ELN) - ed.ac.uk
-
ScienceDirect (Elsevier) - Weaver (2008): Dominio de aplicabilidad de QSAR - sciencedirect.com