Autonomous Lab AI · Découverte autonome de matériaux
Un laboratoire autonome n'échoue pas parce que son optimiseur est faible. Il échoue parce qu'une grande partie des expériences qu'il exécute sont chimiquement impossibles dès la première ligne de la recette, et parce que rien de tout cela n'est prouvable par la suite. Sur ce benchmark, notre boucle fermée Design-Make-Test-Analyze atteint une spécification stricte en 75 expériences là où le criblage aléatoire en nécessite environ 1 491, tandis qu'un sas de sécurité sur jumeau numérique bloque chaque synthèse irréalisable avant que des réactifs ou des heures-robot ne soient dépensés, et signe chaque décision dans un enregistrement ALCOA+ infalsifiable. Les agents conseillent, le code décide.
$4,419
Gaspillage de réactifs évité par le sas sur jumeau numérique, bloquant 38 synthèses vouées à l'échec et économisant 90,1 heures-robot
Exécution du benchmark sur la graine 411, objectif synthétique
20× moins
75 expériences pour obtenir un matériau conforme aux spécifications contre environ 1 491 pour le criblage aléatoire sur le même objectif caché
Exécution du benchmark sur la graine 411, 19,9 fois moins
113
Enregistrements ALCOA+ chaînés par hachage, un par décision, infalsifiables. Modifiez-en un et la chaîne se rompt
Exécution du benchmark sur la graine 411, 75 synthèses plus 38 blocages
Une démonstration exécutable du mécanisme sur une recherche de composition et de procédé de pérovskite sans plomb à 18 dimensions. L'optimiseur et le sas de sécurité fonctionnent entièrement sous numpy et scipy sans clé d'API ; les deux agents conseillers sont la seule partie pouvant appeler un modèle.
Le goulot d'étranglement n'est pas le modèle de substitution. Ce sont les expériences vouées à l'échec que le modèle n'aurait jamais dû proposer, et le fait que rien de tout cela n'est prouvable par la suite.
L'A-Lab de Berkeley a rapporté un taux de réussite de 71 pour cent, ce qui signifie qu'environ 29 pour cent de ses tentatives n'ont pas abouti à la cible (A-Lab, Nature, 2023). Dans un laboratoire autonome, cette part d'échec ne représente pas seulement une perte de rendement. Ce sont des réactifs distribués, des heures-robot réservées et du temps d'instrument gaspillé sur des synthèses à charge déséquilibrée, géométriquement instables ou chimiquement dangereuses avant même que le robot ne s'active.
L'espace de recherche aggrave la situation. Un espace de composition et de procédé de pérovskite de cette taille est astronomiquement plus grand que tout budget de criblage, de sorte que le criblage pur n'est pas une stratégie, c'est une loterie. Un test de faisabilité distinct sur ce benchmark a révélé un taux de réussite aléatoire de 0,01 pour cent, soit 8 candidats sur 80 000, ce qui implique de l'ordre de 10 000 expériences prévues pour atteindre une première cible par le seul criblage. Une meilleure fonction d'acquisition permet de résoudre cette moitié du problème.
Elle ne fait rien pour l'autre moitié. Un modèle de propriétés, aussi performant soit-il, ne peut pas décider si une synthèse peut être tentée en toute sécurité, et ne peut pas produire un enregistrement qu'un régulateur ou votre propre AQ accepterait. Les principes directeurs de la FDA et de l'EMA pour l'IA dans le développement de médicaments précisent explicitement que la traçabilité doit être attribuable et contemporaine (FDA/EMA, 2026). La faisabilité et l'auditabilité sont précisément les aspects auxquels le modèle ne touche pas, et ce sont les deux lacunes que nous avons entrepris de combler.
Un cycle Design-Make-Test-Analyze, présenté étape par étape. La décision de faisabilité réside dans du code pur, jamais dans un modèle.
La boucle explore un espace de pérovskite sans plomb à 18 dimensions : ratios de cations Cs, MA et FA, substitution sur le site B par Sn, Ge et Bi, ratios d'halogénures I, Br et Cl, ainsi que des variables de procédé. Un modèle de substitution par processus gaussien avec une acquisition orientée cible de type ParEGO propose le candidat suivant, initialisé à froid à partir d'un jeu de données historique de 60 enregistrements. Chaque proposition passe ensuite par le sas avant toute synthèse, de sorte que le sas, et non la confiance de l'optimiseur, est ce qui s'interpose entre une recette et le robot.
Le sas sur jumeau numérique est la composante située hors de tout modèle de langage. Chaque candidat proposé est vérifié par rapport à cinq règles de chimie réelles et publiées avant de pouvoir consommer un réactif, et le sas renvoie le statut faisable ou bloqué avec la règle exacte enfreinte ainsi que le budget de réactifs et les heures-robot évités. Il s'agit de simple code numpy et scipy, il réside en dehors des agents et du substitut, et constitue la décision structurelle. Une recette vouée à l'échec est arrêtée ici, et non découverte après que le robot l'a déjà exécutée.
Au-dessus du noyau, deux agents lisent et communiquent. Un Lab Director commente la stratégie de campagne, et un Critic signale indépendamment les dérives ou blocages, agissant comme un vérificateur dans la boucle. Ils sont interchangeables quant au fournisseur via un paramètre LLM_PROVIDER et utilisent par défaut claude-opus-4-8 ; sans clé, ils basculent sur une narration déterministe afin que la démonstration s'exécute toujours. L'optimiseur et le sas ne dépendent jamais du LLM. Les agents conseillent, le code décide.
| Contrôle | Ce qu'il détecte | Fondement |
|---|---|---|
| Facteur de tolérance de Goldschmidt | Composition en dehors de la fenêtre de formabilité de la pérovskite ; le sas utilise une plage de sélection de 0,78 à 1,05. | Cristallochimie des pérovskites |
| Facteur octaédrique | Rapport de rayons hors de la fenêtre d'octaèdres stables de 0,41 à 0,90. | Cristallochimie des pérovskites |
| Neutralité de charge | Charge non compensée sur le site B, par exemple issue d'une substitution par Bi(III). | Équilibre de charge ionique |
| Risque d'oxydation de Sn(II) | Sn(II) qui s'oxyde à l'air humide, dangereux et voué à l'échec à l'humidité de procédé. | Stabilité des halogénures d'étain |
| Plafond de décomposition | Recuit au-dessus de la température de dégradation des cations MA et FA, environ 190 degrés Celsius. | Stabilité thermique des précurseurs |
La valeur durable réside dans le sas de sécurité et la piste d'audit, non dans un meilleur substitut. Même un modèle de propriétés parfait ne peut empêcher l'exécution d'une synthèse à charge déséquilibrée ou à risque d'oxydation, ni produire un enregistrement acceptable pour un régulateur. L'optimiseur est un composant interchangeable au sein de cette couche de contrôle, raison pour laquelle l'approche ne devient pas obsolète à mesure que les modèles progressent. Tel que livré, l'optimiseur est un GP sous numpy et scipy avec acquisition orientée cible ; l'alternative pour la production est BoTorch et Ax.
Chaque chiffre ci-dessous provient d'une unique campagne de benchmark déterministe (graine 411), calculé en direct à l'exécution et non codé en dur. L'objectif est un benchmark synthétique fondé sur la physique, et non des données réelles de DFT ou de laboratoire, et le laboratoire est un simulateur derrière une interface conforme à SiLA-2. Rien ici n'a été physiquement synthétisé.
La boucle fermée atteint la spécification cible à l'expérience 75, en utilisant 19,9 fois moins d'expériences que les quelque 1 491 prévues par le criblage aléatoire sur le même objectif caché. En parallèle, le tableau de bord suit les chiffres qui comptent plus que la vitesse : 4 419 dollars américains de gaspillage de réactifs évités, 90 heures-robot économisées et 38 candidats irréalisables bloqués avant synthèse, avec le statut de spécification indiquant spécification atteinte. L'efficacité est réelle, mais le gaspillage évité et la traçabilité sont les atouts qui perdurent quelle que soit la qualité du modèle.
Voici un blocage en détail. Un candidat proposé présente un risque d'oxydation de Sn(II) à l'humidité de procédé, et son bandgap prédit, sa stabilité de phase et sa décomposition sont tous hors cible. Le sas le refuse avant la synthèse, économisant 105 dollars américains de réactifs et 2,33 heures-robot, et consigne le refus sous forme d'enregistrement ALCOA+ chaîné par hachage. L'optimiseur ne passe ainsi jamais une heure-robot à découvrir ce que la chimie déterministe savait déjà.
Ce blocage individuel n'est pas un coup de chance, c'est la norme. Tout au long de l'exécution, le sas a bloqué 38 candidats irréalisables avant synthèse, et chacun précise la loi physique enfreinte : risque d'oxydation de Sn(II), neutralité de charge violée par un site B non compensé ou tolérance de Goldschmidt hors de la fenêtre de formabilité, ainsi que les dollars et heures-robot économisés. Les blocages totalisent 4 419 dollars américains et 90 heures-robot de gaspillage évité, et aucune synthèse irréalisable n'a été exécutée.
La carte de découverte représente chaque matériau synthétisé en simulation par la boucle dans l'espace bandgap / stabilité de phase, coloré selon la température de décomposition, avec une boîte en pointillés marquant la fenêtre cible : un bandgap de 1,2 à 1,5 eV avec une haute stabilité. Les premiers points sont dispersés ; les points ultérieurs se regroupent vers la boîte au fur et à mesure de l'apprentissage du substitut, et le meilleur matériau s'y installe. C'est là l'optimiseur accomplissant sa tâche, mais uniquement sur les candidats que le sas a laissés passer.
Le meilleur matériau trouvé répond à chaque spécification : composition (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3, avec un bandgap de 1,43 eV, un score de stabilité de phase de 0,743 et une température de décomposition de 250,5 degrés Celsius. Pour préciser le périmètre, il s'agit du résultat d'un objectif synthétique guidé par la physique, et non d'un matériau fabriqué par quiconque. C'est la preuve que la boucle converge, et non la revendication d'une découverte réelle.
Chaque décision, tant les 75 synthèses que les 38 blocages, est consignée dans un enregistrement en ajout seul, soit 113 au total, et exportée sous forme de rapport de traçabilité de campagne conforme aux principes ALCOA+. Chaque ligne comporte son horodatage, son action, le candidat, le verdict du sas, les violations, la justification et un hachage SHA-256 la chaînant à l'enregistrement précédent. Le rapport indique chaîne intacte et infalsifiable, ce qui constitue la traçabilité attribuable et contemporaine qu'un laboratoire réglementé doit déposer.
L'inviolabilité ne vaut d'être affirmée que si vous pouvez la voir se déclencher. Modifiez une seule charge utile dans l'audit exporté et le vérificateur signale la chaîne rompue à cet enregistrement, altération détectée, et déclare que l'audit déposé est manifestement altéré. L'intérêt n'est pas que l'enregistrement ne puisse être modifié, mais qu'une modification ne puisse être dissimulée, ce qui rend la piste d'audit défendable.
C'est le cerveau, le sas de sécurité et la couche de traçabilité sur votre matériel existant, et non un laboratoire hébergé ni un substitut à vos instruments ou à la DFT.
| Préoccupation | Un modèle de propriétés ou un optimiseur seul | Cette couche |
|---|---|---|
| Propositions chimiquement impossibles | Synthétisées, puis notées comme échecs | Bloquées par un sas déterministe avant toute dépense de réactif |
| Pourquoi un candidat a été rejeté | Enseveli dans la fonction de perte, si tant est qu'il soit consigné | Explicité au regard de cinq règles de chimie publiées, avec les dollars et heures économisés |
| Traçabilité d'une décision automatisée | Journaux ad hoc, modifiables | Enregistrement ALCOA+ en ajout seul chaîné par hachage, infalsifiable |
| Qui prend la décision de sécurité | Un LLM, ou la propre confiance de l'optimiseur | Du code simple et déterministe hors des agents |
| Efficacité d'échantillonnage | Varie selon la fonction d'acquisition | 75 contre environ 1 491 expériences jusqu'aux spécifications sur l'objectif caché de ce benchmark |
| Verrouillage matériel et de modèle | Souvent une suite logicielle hébergée | Fonctionne sur vos instruments via une interface conforme à SiLA-2, fournisseur de LLM interchangeable |
La couche constitue le cerveau, le sas de sécurité et le registre de traçabilité installés sur le matériel que vous possédez déjà. La boucle fermée décide de la prochaine étape à exécuter et atteint une spécification stricte en beaucoup moins d'expériences, un sas déterministe sur jumeau numérique refuse les synthèses chimiquement impossibles ou dangereuses avant qu'elles ne consomment des réactifs et des heures-robot, et chaque décision est consignée dans une piste d'audit infalsifiable. Sur ce benchmark, le sas a bloqué 38 synthèses vouées à l'échec et économisé 4 419 dollars américains ainsi que 90,1 heures-robot, et aucune expérience irréalisable n'a atteint le robot.
Non, et nous sommes explicites à ce sujet. L'objectif est un benchmark synthétique fondé sur la physique, et non des données réelles de DFT ou de laboratoire, et le laboratoire est un simulateur derrière une interface conforme à SiLA-2, de sorte que rien ici n'a été physiquement fabriqué. Ce que la démonstration prouve, c'est le mécanisme, la boucle, le sas de sécurité déterministe et la traçabilité auditable, qui restent valables quelle que soit la qualité du modèle. La composition découverte et ses valeurs de propriétés sont des résultats de benchmark, non un résultat expérimental.
Les contraintes d'un optimiseur résident au sein du même modèle qui cherche à atteindre la cible, et elles ne sont fiables qu'à la mesure de l'auto-évaluation de ce modèle. Notre sas est un code déterministe distinct qui s'exécute hors des agents et du substitut, et il vérifie chaque proposition au regard de cinq règles de chimie publiées : tolérance de Goldschmidt, facteur octaédrique, neutralité de charge, oxydation de Sn(II) à l'humidité et plafond de décomposition des précurseurs organiques. Il renvoie le statut faisable ou bloqué avec la règle exacte enfreinte ainsi que les dollars et heures-robot évités, de sorte qu'une recette vouée à l'échec est arrêtée avant même que le robot ne la voie.
Parce que les agents ne prennent jamais la décision. Les agents Lab Director et Critic se bornent à commenter la stratégie et à signaler les dérives, tandis que l'optimiseur et le sas déterministe décident de ce qui s'exécute, et aucun des deux ne dépend du LLM. Sans clé d'API, les agents basculent sur une narration déterministe et la boucle s'exécute de façon identique. Cette séparation, les agents conseillent et le code décide, est tout l'enjeu : la confiance dans un laboratoire autonome ne saurait reposer sur la seule auto-évaluation d'un modèle.
La traçabilité est présente et alignée sur les principes ALCOA+ : chaque décision génère un enregistrement en ajout seul chaîné par hachage, et modifier un enregistrement quelconque rompt visiblement la chaîne, ce qui correspond à la traçabilité attribuable et contemporaine exigée par les principes directeurs de la FDA et de l'EMA (FDA/EMA, 2026). Le système n'est pas validé IQ, OQ ou PQ selon vos SOP, et cette qualification constitue la mission d'accompagnement, non une promesse prête à l'emploi. La démonstration présente l'enregistrement et le test d'altération afin que vous puissiez juger du fond plutôt que d'une simple case à cocher.
Il s'agit d'une exécution déterministe unique, graine 411 : 75 expériences pour obtenir un matériau conforme aux spécifications contre environ 1 491 prévues pour un criblage aléatoire sur le même objectif caché, soit 19,9 fois moins. Sur un benchmark à 10 graines, la boucle a nécessité en moyenne 67 expériences et a résolu 9 exécutions sur 10, tandis que le criblage aléatoire n'en a résolu que 1 sur 5 en 1 000 essais et qu'un balayage sur grille n'a jamais atteint les spécifications. Le périmètre compte : ce sont des chiffres comparant l'optimiseur à des références sur un objectif synthétique, mesurés face à des bases reproductibles plutôt qu'un modèle simpliste, et non une promesse universelle.
Non. Nous n'exploitons pas de laboratoire robotique hébergé, et la couche est conçue pour s'installer sur vos instruments via une interface conforme à SiLA-2. L'optimiseur et le sas reposent sur du simple code numpy et scipy et s'exécutent entièrement hors ligne sans clé d'API, et le fournisseur de LLM est interchangeable, avec claude-opus-4-8 par défaut. Tel que livré, l'optimiseur est un GP avec acquisition orientée cible, et l'alternative pour la production est BoTorch et Ax, sur votre matériel et non le nôtre.
La recherche derrière cette démonstration — l'architecture, la conception de la vérification et le modèle pour l'entreprise.
Solution complète
Découvrir la solution Autonomous Lab AI →Atteignez les spécifications en moins d'expériences, bloquez les synthèses vouées à l'échec avant leur exécution et prouvez chaque décision par la suite.
Si votre équipe met en place un laboratoire autonome et cherche comment fiabiliser la décision de faisabilité et rendre la traçabilité irréfutable, nous serions ravis d'échanger sur votre approche. Le problème concerne l'ensemble de l'industrie, et les réponses le seront tout autant.