Un modelo de IA para la síntesis química resuelve nueve de cada diez rutas que hasta ahora exigían el criterio de un especialista. Se llama RetroChimera y su arquitectura y validación se describen en un artículo publicado en Nature, según el anuncio oficial del equipo que lo ha desarrollado, Microsoft Research. El dato que sorprende no es solo el nueve de diez: en pruebas ciegas, químicos con doctorado prefirieron sus predicciones a las de los sistemas anteriores y, en algunos casos, a reacciones reales recogidas en la literatura científica.
Nueve de cada diez rutas complejas, frente a cinco del mejor submodelo
La validación más exigente del trabajo es un experimento con objetivos difíciles. Diez moléculas complejas, diez planes de síntesis completos que debían ser aceptados o rechazados por químicos expertos. RetroChimera resolvió nueve de esos diez objetivos. Sus dos componentes por separado se quedaron en cinco y cuatro, y el sistema de referencia NeuralSym, en dos. No es una diferencia de matiz.
La segunda prueba fue a ciegas y a escala de reacción individual. Los evaluadores no sabían de dónde venía cada propuesta y, aun así, prefirieron las desconexiones sugeridas por RetroChimera a las de sus propios componentes, a las de enfoques más asentados y, en ciertos casos, a reacciones documentadas en la literatura. El detalle tiene miga. Un modelo que propone rutas que un químico considera mejores que lo publicado no está repitiendo el pasado: lo está reordenando.
Conviene recordar qué es la retrosíntesis. Se parte de la molécula objetivo y se deshace hacia atrás, paso a paso, hasta llegar a precursores que se pueden comprar. Quien planifica lo hace como un jugador de ajedrez: evalúa movimientos inmediatos mientras sostiene una estrategia de conjunto. La diferencia es que aquí el tablero tiene muchísimas más casillas. Las reacciones posibles para una molécula dada no están listadas en ninguna parte, y las más valiosas suelen ser las raras.
Ese cuello de botella tiene consecuencias económicas. La síntesis es uno de los principales motores del coste de desarrollo de un fármaco, y la química computacional ya puede explorar millones de moléculas nuevas que nadie sabe cómo fabricar. Ahí entra el modelo: propone rutas de alta calidad de forma automática, sin esperar a que un especialista las dibuje a mano.
Diseñar una molécula dejó de ser el problema. El problema es encontrar el camino para fabricarla.
Dos modelos que se equivocan de forma distinta

RetroChimera no es una red neuronal. Son dos, y no se parecen en nada. R-SMILES 2 es un modelo Transformer de generación libre: predice las moléculas precursoras directamente a partir de la molécula de partida, lo que le da flexibilidad para aprender patrones reacción a reacción, pero también lo expone a inventar estructuras que no existen. NeuralLoc es una red neuronal de grafos que trabaja con plantillas: selecciona una y decide dónde aplicarla sobre la molécula objetivo. Es más fiable y más rígido.
Dos modelos que se equivocan en sitios distintos valen más que uno que acierta a medias.
La gracia está en que sus errores no se solapan. R-SMILES 2 rinde mejor cuando la reacción transforma mucho la molécula; NeuralLoc destaca en reacciones poco frecuentes y en cambios localizados. Sobre esa complementariedad, el equipo monta un sistema de reordenación aprendido: cada submodelo emite un voto que depende del puesto que ocupa su propuesta, y los votos se suman cuando ambos coinciden. El resultado se acerca a lo mejor de cada uno en casi todas las clases de reacción.
El modelo también recuerda reacciones raras, las que más cuesta replicar cuando un proyecto se atasca, y mantiene el tipo fuera de los datos con los que fue entrenado. Los autores describen transferencia directa y ajuste fino sobre conjuntos de datos propietarios, dos capacidades que importan a quien trabaja con moléculas que no aparecen en la literatura.
RetroChimera está disponible en abierto. El código y los pesos se publican en GitHub con licencia MIT y también se puede acceder a él a través de Microsoft Foundry, con una intención declarada: que la comunidad química lo pruebe, encuentre sus fallos y los reporte. El equipo invita expresamente a medirlo con objetivos distintos a los del artículo.
Lo que la retrosíntesis automática todavía no resuelve
Visto desde fuera, la retrosíntesis automática lleva años siendo una promesa razonable y una decepción parcial. Los sistemas previos fallaban justo en lo que más importa: recordar reacciones raras pero estratégicas, comportarse bien fuera de los datos de entrenamiento, y alinearse con el criterio de un químico de verdad. Este trabajo ataca las tres cosas a la vez con un truco conceptualmente sencillo: en lugar de buscar el modelo perfecto, combinar dos imperfectos que fallan en sitios distintos.
Eso sí, conviene poner el resultado en su sitio. Una predicción, por buena que sea, sigue siendo una hipótesis hasta que alguien la prueba en el laboratorio: el modelo propone desconexiones plausibles, no garantiza rendimiento, condiciones de reacción ni seguridad. La generación libre mantiene su riesgo de invención y cualquier sistema basado en plantillas hereda los límites de su biblioteca. Y hay una pregunta que el artículo no cierra: cuánto de ese nueve de cada diez depende de objetivos parecidos a los que ya estaban en los datos de entrenamiento. Me parece, eso sí, más sólido el método de validación que el porcentaje. El juicio ciego de expertos con doctorado es un filtro duro y difícil de maquillar, y el trabajo ha pasado revisión por pares en Nature: no es un preprint colgado en un repositorio.
La línea que se abre es la del bucle cerrado. Si la planificación se automatiza y la robótica de laboratorio sigue ganando terreno, el ciclo diseñar-fabricar-probar-medir puede empezar a girar sin intervención humana en cada vuelta. El siguiente hito verificable está en manos de la comunidad: el código es público, los pesos están publicados y los autores piden que se pruebe con objetivos ajenos a los del artículo. Ahí se verá si el nueve de cada diez se sostiene fuera del laboratorio donde nació.
🔬 Ficha del Descubrimiento
- Qué se ha descubierto: RetroChimera, un modelo de IA que propone rutas de retrosíntesis y resolvió nueve de diez objetivos complejos ante el juicio ciego de químicos con doctorado.
- Dónde: Desarrollado en los laboratorios de Microsoft Research (Estados Unidos) y validado con evaluadores externos.
- Institución responsable: Microsoft Research, con publicación revisada por pares en la revista Nature.
- Cuándo: Estudio publicado en Nature; el código y los pesos están disponibles en abierto desde su publicación.
- Impacto a futuro: Acelerar el ciclo de diseño, síntesis y prueba de nuevos fármacos y materiales avanzados.




