Autonomous Lab AI · Descubrimiento autónomo de materiales
Un laboratorio autónomo no fracasa porque su optimizador sea débil. Fracasa porque una gran parte de los experimentos que ejecuta son químicamente imposibles desde la primera línea de la receta, y porque nada de ello es demostrable después. En este benchmark, nuestro bucle cerrado de Diseño-Fabricación-Prueba-Análisis alcanza una especificación exigente en 75 experimentos, donde el cribado aleatorio necesita alrededor de 1.491, mientras que una compuerta de seguridad basada en gemelo digital bloquea cada síntesis inviable antes de que se gasten reactivos u horas-robot, y firma cada decisión en un registro ALCOA+ a prueba de manipulaciones. Los agentes asesoran, el código decide.
$4,419
Desperdicio de reactivos evitado por la compuerta de gemelo digital, bloqueando 38 síntesis condenadas al fracaso y ahorrando 90,1 horas-robot
Ejecución de benchmark con semilla 411, objetivo sintético
20× menos
75 experimentos para un material que cumple las especificaciones frente a unos 1.491 del cribado aleatorio con el mismo objetivo oculto
Ejecución de benchmark con semilla 411, 19,9 veces menos
113
Registros ALCOA+ encadenados por hash, uno por decisión, a prueba de manipulaciones. Modifique uno y la cadena se romperá
Ejecución de benchmark con semilla 411, 75 síntesis más 38 bloqueos
Una demostración ejecutable del mecanismo en una búsqueda de composición y proceso de perovskita libre de plomo en 18 dimensiones. El optimizador y la compuerta de seguridad se ejecutan íntegramente en numpy y scipy sin clave de API; los dos agentes asesores son la única parte que puede llamar a un modelo.
El cuello de botella no es el modelo sustituto. Son los experimentos condenados al fracaso que el modelo nunca debió haber propuesto, y el hecho de que nada de ello sea demostrable más adelante.
El A-Lab de Berkeley reportó una tasa de éxito del 71 por ciento, lo que significa que aproximadamente el 29 por ciento de sus intentos no arrojaron el objetivo (A-Lab, Nature, 2023). En un laboratorio que se autogestiona, esa proporción de fracasos no es solo rendimiento perdido. Son reactivos dispensados, horas-robot reservadas y tiempo de instrumentos consumido en síntesis que tenían desbalance de carga, eran geométricamente inestables o eran químicamente peligrosas antes de que el robot se moviera.
El espacio de búsqueda lo empeora aún más. Un espacio de composición y proceso de perovskitas de este tamaño es astronómicamente mayor que cualquier presupuesto de cribado, por lo que el cribado puro no es una estrategia, es una lotería. Un sondeo de viabilidad independiente en este benchmark detectó una tasa de acierto aleatorio del 0,01 por ciento, 8 candidatos en 80.000, lo que implica un orden de 10.000 experimentos esperados para alcanzar un primer objetivo solo mediante cribado. Una mejor función de adquisición ayuda con esa mitad del problema.
No hace nada por la otra mitad. Un modelo de propiedades, por bueno que sea, no puede decidir si es seguro intentar una síntesis, ni puede generar un registro que un regulador o su propio equipo de control de calidad (QA) acepten. Los principios rectores de la FDA y la EMA para la IA en el desarrollo de fármacos son explícitos en cuanto a que la procedencia debe ser atribuible y contemporánea (FDA/EMA, 2026). La viabilidad y la auditabilidad son exactamente las partes que el modelo no aborda, y son las dos brechas que nos propusimos cerrar.
Un ciclo de Diseño-Fabricación-Prueba-Análisis, mostrado etapa por etapa. La decisión de viabilidad reside en código puro, nunca en un modelo.
El bucle explora un espacio de perovskita libre de plomo de 18 dimensiones: proporciones de cationes Cs, MA y FA, sustitución en el sitio B de Sn, Ge y Bi, proporciones de haluros de I, Br y Cl, además de variables de proceso. Un modelo sustituto de procesos gaussianos con adquisición orientada a objetivos de estilo ParEGO propone el siguiente candidato, inicializado en frío a partir de un conjunto de datos histórico de 60 registros. Cada propuesta pasa luego por la compuerta antes de sintetizar nada, por lo que la compuerta, y no la confianza del optimizador, es lo que se interpone entre una receta y el robot.
La compuerta de gemelo digital es la parte exterior a cualquier modelo de lenguaje. Cada candidato propuesto se verifica frente a cinco reglas químicas reales y publicadas antes de que pueda consumir un reactivo, y la compuerta devuelve viable o bloqueado con la regla exacta infringida y el presupuesto de reactivos y las horas-robot evitadas. Es código simple de numpy y scipy, se ubica fuera de los agentes y del sustituto, y es la decisión estructural clave. Una receta condenada al fracaso se detiene aquí, no se descubre después de que el robot ya la haya ejecutado.
Sobre el núcleo, dos agentes leen y se comunican. Un Director de Laboratorio narra la estrategia de la campaña y un Crítico señala de forma independiente desviaciones o estancamientos, como un verificador en el bucle. Son intercambiables de proveedor mediante la configuración LLM_PROVIDER y tienen como valor predeterminado claude-opus-4-8; sin clave recurren a una narración determinista para que la demostración siempre se ejecute. El optimizador y la compuerta nunca dependen del LLM. Los agentes asesoran, el código decide.
| Comprobación | Qué detecta | Fundamento |
|---|---|---|
| Factor de tolerancia de Goldschmidt | Composición fuera de la ventana de formabilidad de la perovskita; la compuerta utiliza una banda de cribado de 0,78 a 1,05. | Química cristalina de perovskitas |
| Factor octaédrico | Relación de radios fuera de la ventana de octaedros estables de 0,41 a 0,90. | Química cristalina de perovskitas |
| Neutralidad de carga | Carga no compensada en el sitio B, por ejemplo a partir de la sustitución con Bi(III). | Balance de carga iónica |
| Peligro de oxidación de Sn(II) | Sn(II) que se oxida en aire húmedo, inseguro y condenado al fracaso con la humedad del proceso. | Estabilidad de haluros de estaño |
| Techo de descomposición | Recocido por encima de la temperatura a la que se degradan los cationes MA y FA, unos 190 grados Celsius. | Estabilidad térmica de precursores |
El valor duradero reside en la compuerta de seguridad y la pista de auditoría, no en un sustituto mejor. Incluso un modelo de propiedades perfecto sigue sin poder impedir la ejecución de una síntesis con desbalance de carga o peligro de oxidación, ni puede generar un registro que un regulador acepte. El optimizador es un componente intercambiable dentro de esa capa de control, por lo que el enfoque no queda obsoleto a medida que los modelos mejoran. Tal como se entrega, el optimizador es un GP de numpy y scipy con adquisición orientada a objetivos; la sustitución para producción es BoTorch y Ax.
Cada número a continuación proviene de una única campaña de benchmark determinista (semilla 411), calculada en tiempo real durante la ejecución, no codificada de forma rígida. El objetivo es un benchmark sintético fundamentado físicamente, no datos reales de DFT o de laboratorio, y el laboratorio es un simulador tras una interfaz con formato SiLA-2. Nada aquí se sintetizó físicamente.
El bucle cerrado alcanza la especificación objetivo en el experimento 75, utilizando 19,9 veces menos experimentos de los que esperaría el cribado aleatorio (aproximadamente 1.491) para el mismo objetivo oculto. A su lado, el marcador registra los números que importan más que la velocidad: 4.419 dólares estadounidenses de desperdicio de reactivos evitados, 90 horas-robot ahorradas y 38 candidatos inviables bloqueados antes de la síntesis, con el estado de especificación indicando especificación cumplida. La eficiencia es real, pero el desperdicio evitado y la procedencia son las partes que se mantienen con cualquier calidad del modelo.
Aquí se muestra un bloqueo en detalle. Un candidato propuesto presenta un peligro de oxidación de Sn(II) con la humedad del proceso, y su bandgap predicho, estabilidad de fase y descomposición quedan fuera del objetivo. La compuerta lo rechaza antes de la síntesis, ahorrando 105 dólares estadounidenses en reactivos y 2,33 horas-robot, y registra el rechazo como un registro ALCOA+ encadenado por hash. El optimizador nunca llega a gastar una hora-robot descubriendo lo que la química determinista ya sabía.
El bloqueo individual no es un hallazgo fortuito, es el patrón. A lo largo de la ejecución, la compuerta bloqueó 38 candidatos inviables antes de la síntesis, y cada uno identifica la física que infringió: peligro de oxidación de Sn(II), neutralidad de carga vulnerada por un sitio B no compensado, o tolerancia de Goldschmidt fuera de la ventana de formabilidad, junto con los dólares y las horas-robot que ahorró. Los bloqueos suman un total de 4.419 dólares estadounidenses y 90 horas-robot de desperdicio evitado, y se ejecutaron cero síntesis inviables.
El mapa de descubrimiento grafica cada material que el bucle sintetizó en simulación en el espacio de bandgap frente a estabilidad de fase, coloreado por temperatura de descomposición, con una casilla discontinua que marca la ventana objetivo: un bandgap de 1,2 a 1,5 eV con alta estabilidad. Los primeros puntos se dispersan; los puntos posteriores se agrupan hacia la casilla a medida que el sustituto aprende, y el mejor material se ubica dentro de ella. Este es el optimizador haciendo su trabajo, pero solo sobre los candidatos que la compuerta permitió pasar.
El mejor material encontrado cumple todas las especificaciones: composición (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3, con un bandgap de 1,43 eV, una puntuación de estabilidad de fase de 0,743 y una temperatura de descomposición de 250,5 grados Celsius. Para ser claros sobre el alcance, este es el resultado de un objetivo sintético fundamentado físicamente, no un material fabricado por alguien. Es la prueba de que el bucle converge, no la afirmación de un descubrimiento real.
Cada decisión, tanto las 75 síntesis como los 38 bloqueos, se escribe en un registro de solo adición, 113 en total, y se exporta como un informe de procedencia de campaña mapeado con los principios ALCOA+. Cada fila contiene su marca temporal, acción, candidato, veredicto de la compuerta, infracciones, justificación y un hash SHA-256 que la encadena con el registro anterior. El informe indica cadena intacta y a prueba de manipulaciones, que es la procedencia atribuible y contemporánea que debe presentar un laboratorio regulado.
La cualidad de ser a prueba de manipulaciones solo vale la pena afirmarla si puede observarse en acción. Modifique una sola carga útil en la auditoría exportada y el verificador informará que la cadena está rota en ese registro, manipulación detectada, e indicará que la auditoría presentada ha sido demostrablemente alterada. La cuestión no es que el registro no pueda modificarse, sino que un cambio no puede ocultarse, lo que hace que la pista sea defendible.
Es el cerebro, la compuerta de seguridad y la capa de procedencia sobre su hardware existente, no un laboratorio alojado ni un sustituto de sus instrumentos o DFT.
| Aspecto | Un modelo de propiedades u optimizador aislado | Esta capa |
|---|---|---|
| Propuestas químicamente imposibles | Sintetizadas, luego calificadas como fracasos | Bloqueadas por una compuerta determinista antes de gastar cualquier reactivo |
| Por qué se rechazó un candidato | Oculto en la función de pérdida, si es que llega a registrarse | Identificado frente a cinco reglas químicas publicadas, con dólares y horas ahorrados |
| Procedencia de una decisión automatizada | Registros ad hoc, editables | Registro ALCOA+ de solo adición y encadenado por hash, a prueba de manipulaciones |
| Quién toma la decisión de seguridad | Un LLM, o la propia confianza del optimizador | Código simple y determinista fuera de los agentes |
| Eficiencia de muestreo | Varía según la función de adquisición | 75 frente a unos 1.491 experimentos para alcanzar la especificación en el objetivo oculto de este benchmark |
| Dependencia de hardware y modelo | A menudo una infraestructura alojada | Se ejecuta en sus instrumentos a través de una interfaz con formato SiLA-2, con proveedor de LLM intercambiable |
La capa es el cerebro, la compuerta de seguridad y el registro de procedencia que se asientan sobre el hardware que ya posee. El bucle cerrado decide qué ejecutar a continuación y alcanza una especificación exigente en muchos menos experimentos, una compuerta determinista de gemelo digital rechaza síntesis químicamente imposibles o peligrosas antes de que consuman reactivos y horas-robot, y cada decisión se escribe en una pista de auditoría a prueba de manipulaciones. En este benchmark, la compuerta bloqueó 38 síntesis condenadas al fracaso y ahorró 4.419 dólares estadounidenses y 90,1 horas-robot, y cero experimentos inviables llegaron al robot.
No, y lo declaramos explícitamente. El objetivo es un benchmark sintético fundamentado físicamente, no DFT real ni datos de laboratorio, y el laboratorio es un simulador tras una interfaz con formato SiLA-2, por lo que nada aquí se fabricó físicamente. Lo que demuestra la demo es el mecanismo: el bucle, la compuerta de seguridad determinista y la procedencia auditable, que se sostienen con cualquier calidad del modelo. La composición descubierta y sus valores de propiedades son resultados de benchmark, no un resultado experimental.
Las restricciones de un optimizador residen dentro del mismo modelo que intenta alcanzar el objetivo, y solo son tan confiables como el propio informe de ese modelo. Nuestra compuerta es código determinista independiente que se ejecuta fuera de los agentes y del sustituto, y verifica cada propuesta frente a cinco reglas químicas publicadas: tolerancia de Goldschmidt, factor octaédrico, neutralidad de carga, oxidación de Sn(II) por humedad y el techo de descomposición de precursores orgánicos. Devuelve viable o bloqueado con la regla exacta infringida y los dólares y horas-robot evitados, por lo que una receta condenada al fracaso se detiene antes de que el robot la vea jamás.
Porque los agentes nunca toman la decisión. Los agentes Director de Laboratorio y Crítico solo narran la estrategia y señalan desviaciones, mientras que el optimizador y la compuerta determinista deciden qué se ejecuta, y ninguno de los dos depende del LLM. Sin clave de API, los agentes recurren a una narración determinista y el bucle sigue ejecutándose de manera idéntica. Esa separación —los agentes asesoran y el código decide— es el punto clave: la confianza en un laboratorio autónomo no puede descansar en la propia versión que un modelo da de sí mismo.
La procedencia está presente y mapeada con los principios ALCOA+: cada decisión escribe un registro de solo adición y encadenado por hash, y editar cualquier registro rompe visiblemente la cadena, que es la procedencia atribuible y contemporánea que exigen los principios rectores de la FDA y la EMA (FDA/EMA, 2026). No está validada para IQ, OQ o PQ frente a su SOP, y esa cualificación es el servicio de consultoría, no algo que afirmemos de fábrica. La demostración muestra el registro y la prueba de manipulación para que pueda juzgar el fondo en lugar de una simple casilla de verificación.
Es una única ejecución determinista, semilla 411: 75 experimentos para un material que cumple las especificaciones frente a aproximadamente 1.491 esperados para el cribado aleatorio con el mismo objetivo oculto, lo que representa 19,9 veces menos. En un benchmark de 10 semillas, el bucle promedió 67 experimentos y resolvió 9 de 10 ejecuciones, mientras que el cribado aleatorio resolvió 1 de 5 en 1.000 intentos y un barrido en cuadrícula nunca alcanzó la especificación. El alcance importa: estas son cifras de optimizador frente a línea base en un objetivo sintético, ejecutadas frente a líneas base reproducibles en lugar de un rival artificial, no una promesa para un entorno abierto.
No. No operamos un laboratorio robótico alojado, y la capa está diseñada para situarse sobre sus instrumentos a través de una interfaz con formato SiLA-2. El optimizador y la compuerta son numpy y scipy puros y se ejecutan completamente fuera de línea sin clave de API, y el proveedor de LLM es intercambiable, con claude-opus-4-8 como valor predeterminado. Tal como se entrega, el optimizador es un GP con adquisición orientada a objetivos, y la sustitución para producción es BoTorch y Ax, sobre su propio hardware, no el nuestro.
La investigación detrás de esta demostración: la arquitectura, el diseño de verificación y el plan para empresas.
Solución completa
Explorar la solución Autonomous Lab AI →Alcance la especificación en menos experimentos, bloquee los condenados al fracaso antes de que se ejecuten y demuestre cada decisión más adelante.
Si su equipo está poniendo en marcha un laboratorio autónomo y evaluando cómo hacer que la decisión de viabilidad sea confiable y la procedencia resulte defendible, nos gustaría mucho conocer su perspectiva. El problema afecta a toda la industria y las soluciones también lo harán.