Autonomous Lab AI · Descoberta Autônoma de Materiais

Um robô executará alegremente a noite toda uma síntese fadada ao fracasso antes de começar. Criamos o portão determinístico que a recusa e a trilha de auditoria que comprova o motivo.

Um laboratório autônomo não falha porque seu otimizador é fraco. Ele falha porque uma grande parte dos experimentos que executa é quimicamente impossível desde a primeira linha da receita e porque nada disso pode ser comprovado posteriormente. Neste benchmark, nosso ciclo fechado de Design-Make-Test-Analyze atinge uma especificação rigorosa em 75 experimentos, onde a triagem aleatória necessita de cerca de 1.491, enquanto um portão de segurança de gêmeo digital bloqueia toda síntese inviável antes que reagentes ou horas-robô sejam gastos e assina cada decisão em um registro ALCOA+ inviolável. Agentes aconselham, o código decide.

$4,419

Desperdício de reagentes evitado pelo portão de gêmeo digital, bloqueando 38 sínteses fadadas ao fracasso e economizando 90,1 horas-robô

Execução de benchmark com semente 411, objetivo sintético

20× menos

75 experimentos para um material que atende à especificação versus cerca de 1.491 na triagem aleatória sob o mesmo objetivo oculto

Execução de benchmark com semente 411, 19,9 vezes menos

113

Registros ALCOA+ encadeados por hash, um por decisão, invioláveis. Edite um e a cadeia se rompe

Execução de benchmark com semente 411, 75 sínteses mais 38 bloqueios

Uma demonstração executável do mecanismo em uma busca de composição e processo de perovskita livre de chumbo em 18 dimensões. O otimizador e o portão de segurança são executados inteiramente em numpy e scipy sem chave de API; os dois agentes consultores são a única parte capaz de chamar um modelo.

A maior parte do orçamento de um laboratório autônomo é gasta provando o que a química já havia descartado

O gargalo não é o modelo substituto. São os experimentos fadados ao fracasso que o modelo nunca deveria ter proposto e o fato de que nada disso pode ser comprovado posteriormente.

O A-Lab de Berkeley relatou uma taxa de sucesso de 71 por cento, o que significa que cerca de 29 por cento de suas tentativas não geraram o alvo (A-Lab, Nature, 2023). Em um laboratório que opera de forma autônoma, essa parcela de falhas não é apenas rendimento perdido. São reagentes dispensados, horas-robô reservadas e tempo de instrumento queimado em sínteses que já apresentavam desequilíbrio de carga, instabilidade geométrica ou perigo químico antes mesmo de o robô se mover.

O espaço de busca piora a situação. Um espaço de composição e processo de perovskita deste tamanho é astronomicamente maior do que qualquer orçamento de triagem, portanto a triagem pura não é uma estratégia, é uma loteria. Uma investigação separada de viabilidade neste benchmark encontrou uma taxa de acerto aleatório de 0,01 por cento, 8 candidatos em 80.000, o que implica uma expectativa da ordem de 10.000 experimentos para alcançar um primeiro alvo apenas por triagem. Uma função de aquisição melhor ajuda nessa metade do problema.

Ela não faz nada pela outra metade. Um modelo de propriedades, por melhor que seja, não pode decidir se uma síntese é segura para ser tentada e não consegue produzir um registro que um órgão regulador ou seu próprio controle de qualidade (QA) aceitem. Os princípios norteadores da FDA e da EMA para IA no desenvolvimento de medicamentos são explícitos ao exigir que a procedência seja atribuível e contemporânea (FDA/EMA, 2026). Viabilidade e auditabilidade são exatamente as partes que o modelo não aborda, e são as duas lacunas que nos propusemos a fechar.

Um ciclo fechado propõe; um portão determinístico fora dos agentes decide o que tem permissão para executar

Um ciclo de Design-Make-Test-Analyze, apresentado uma etapa por vez. A decisão de viabilidade reside em código puro, nunca em um modelo.

O ciclo busca em um espaço de perovskita livre de chumbo em 18 dimensões: proporções de cátions Cs, MA e FA, substituição no sítio B por Sn, Ge e Bi, proporções de haletos I, Br e Cl, além de variáveis de processo. Um modelo substituto de processo gaussiano com uma função de aquisição direcionada a alvos no estilo ParEGO propõe o próximo candidato, inicializado a frio a partir de uma base histórica fixa de 60 registros. Cada proposta passa então pelo portão antes que qualquer coisa seja sintetizada, de modo que o portão — e não a confiança do otimizador — é o que se interpõe entre uma receita e o robô.

Substituto de GP (propor) → portão de gêmeo digital (viável ou bloqueado, código puro) → sintetizar e caracterizar, formato SiLA-2 (simulado) → analisar e atualizar substituto → registro ALCOA+ (encadeado por hash). Agentes Diretor de Laboratório e Crítico narram e sinalizam desvios em paralelo, sem nunca decidir.

O núcleo determinístico de confiança

O portão de gêmeo digital é a parte fora de qualquer modelo de linguagem. Cada candidato proposto é verificado em relação a cinco regras químicas reais e publicadas antes que possa consumir um reagente, e o portão retorna como viável ou bloqueado com a regra exata violada, além do orçamento de reagentes e das horas-robô evitados. Trata-se de código puro em numpy e scipy, situado fora dos agentes e do substituto, sendo a decisão estrutural. Uma receita fadada ao fracasso é interrompida aqui, não descoberta depois que o robô já a executou.

Os agentes, limitados a aconselhar

Acima do núcleo, dois agentes leem e se comunicam. Um Diretor de Laboratório narra a estratégia da campanha e um Crítico sinaliza de forma independente desvios ou paralisações, atuando como um verificador no circuito. Eles são intercambiáveis por provedor por meio de uma configuração LLM_PROVIDER e usam claude-opus-4-8 por padrão; sem chave de API, recorrem a uma narração determinística para que a demonstração sempre funcione. O otimizador e o portão nunca dependem do LLM. Agentes aconselham, o código decide.

As cinco verificações de viabilidade que o portão impõe

Verificação O que detecta Fundamento
Fator de tolerância de Goldschmidt Composição fora da janela de formabilidade da perovskita; o portão utiliza uma faixa de triagem de 0,78 a 1,05. Química cristalina da perovskita
Fator octaédrico Razão de raios fora da janela de octaedros estáveis de 0,41 a 0,90. Química cristalina da perovskita
Neutralidade de carga Carga não compensada no sítio B, por exemplo decorrente da substituição por Bi(III). Balanço de carga iônica
Risco de oxidação de Sn(II) Sn(II) que se oxida em ar úmido, inseguro e inviável na umidade do processo. Estabilidade de haleto de estanho
Teto de decomposição Recozimento acima da temperatura na qual os cátions MA e FA se degradam, cerca de 190 graus Celsius. Estabilidade térmica do precursor

O valor duradouro é o portão de segurança e a trilha de auditoria, não um substituto melhor. Mesmo um modelo de propriedades perfeito ainda não consegue impedir a execução de uma síntese com desequilíbrio de carga ou risco de oxidação, e não pode produzir um registro que um regulador aceite. O otimizador é um componente intercambiável dentro dessa camada de controle, razão pela qual a abordagem não se torna obsoleta à medida que os modelos evoluem. Conforme fornecido, o otimizador é um GP em numpy e scipy com aquisição direcionada a alvos; a substituição para produção é o BoTorch e Ax.

A execução, na tela

Todos os números abaixo são de uma única campanha de benchmark determinística (semente 411), calculados em tempo real durante a execução, e não fixos no código. O objetivo é um benchmark sintético com fundamentação física, e não dados reais de DFT ou de laboratório, sendo o laboratório um simulador por trás de uma interface no padrão SiLA-2. Nada aqui foi sintetizado fisicamente.

O painel de resultados: o que o ciclo gastou e o que economizou

O ciclo fechado atinge a especificação-alvo no experimento 75, utilizando 19,9 vezes menos experimentos do que os cerca de 1.491 esperados para a triagem aleatória no mesmo objetivo oculto. Ao lado, o painel acompanha os números que importam mais do que a velocidade: US$ 4.419 de desperdício de reagentes evitados, 90 horas-robô economizadas e 38 candidatos inviáveis bloqueados antes da síntese, com o status da especificação indicando especificação atendida. A eficiência é real, mas o desperdício evitado e a procedência são as partes que se sustentam em qualquer nível de qualidade do modelo.

O painel ao vivo mostrando 75 experimentos executados, 19,9 vezes menos do que os cerca de 1.491 da triagem aleatória, US$ 4.419 de desperdício evitados pelo gêmeo digital, 90 horas-robô economizadas, 38 inviáveis bloqueados antes da síntese e o status da especificação indicando especificação atendida no experimento 75.
O painel: 75 experimentos, 19,9 vezes menos do que o aleatório, US$ 4.419 e 90 horas-robô economizadas, 38 inviáveis bloqueados, especificação atendida no experimento 75.

O diferencial: uma receita fadada ao fracasso interrompida antes de chegar ao robô

Aqui está um bloqueio em detalhes. Um candidato proposto apresenta risco de oxidação de Sn(II) na umidade do processo, e seu bandgap previsto, estabilidade de fase e decomposição estão todos fora do alvo. O portão o rejeita antes da síntese, economizando 105 dólares americanos de reagente e 2,33 horas-robô, e registra a recusa como um registro ALCOA+ encadeado por hash. O otimizador nunca chega a gastar uma hora-robô para descobrir o que a química determinística já sabia.

Um painel de detalhes do candidato bloqueado indicando bloqueado antes da síntese, com bandgap previsto, estabilidade de fase e decomposição todos marcados como fora do alvo, risco de oxidação de Sn(II) na umidade do processo como motivo, 105 dólares americanos de reagente e 2,33 horas-robô economizados, e um comprovante ALCOA+ encadeado por hash para o registro 111.
Um único bloqueio: propriedades previstas fora do alvo, risco de oxidação de Sn(II) identificado e US$ 105 mais 2,33 horas-robô economizados antes da síntese.

Trinta e oito bloqueios, cada um identificando sua química

O bloqueio individual não é um golpe de sorte, é o padrão. Ao longo da execução, o portão bloqueou 38 candidatos inviáveis antes da síntese, e cada um identifica a física violada: risco de oxidação de Sn(II), neutralidade de carga violada por um sítio B não compensado ou tolerância de Goldschmidt fora da janela de formabilidade, juntamente com os dólares e as horas-robô economizados. Os bloqueios totalizam US$ 4.419 e 90 horas-robô de desperdício evitado, e zero sínteses inviáveis foram executadas.

A lista completa de bloqueados pelo gêmeo digital mostrando 38 candidatos inviáveis interceptados antes da síntese, com cada linha identificando sua violação, como risco de oxidação de Sn(II), neutralidade de carga violada ou tolerância de Goldschmidt fora da janela de formabilidade, acompanhada dos dólares e horas-robô economizados por candidato e 4.419 dólares e 90 horas-robô de desperdício evitado no total.
Todos os 38 bloqueios, cada um com sua violação química identificada e o orçamento de reagentes e horas-robô economizados, nenhum deles jamais sintetizado.

O ciclo convergindo para a caixa de especificação-alvo

O mapa de descoberta plota cada material sintetizado pelo ciclo em simulação no espaço de bandgap versus estabilidade de fase, colorido pela temperatura de decomposição, com uma caixa tracejada demarcando a janela-alvo: um bandgap de 1,2 a 1,5 eV com alta estabilidade. Os pontos iniciais dispersam-se; os pontos posteriores agrupam-se em direção à caixa à medida que o substituto aprende, e o melhor material posiciona-se dentro dela. Este é o otimizador fazendo seu trabalho, mas apenas nos candidatos que o portão autorizou passar.

O mapa de descoberta, uma dispersão de materiais sintetizados plotados por bandgap no eixo x e estabilidade de fase no eixo y, coloridos pela temperatura de decomposição, com uma caixa de especificação-alvo tracejada na região superior esquerda e o melhor material exibido como um ponto brilhante situado dentro dessa janela-alvo.
Bandgap versus estabilidade de fase: os pontos sintetizados convergem para a caixa-alvo tracejada, com o melhor material posicionando-se dentro dela.

O material que atende à especificação, no experimento 75

O melhor material encontrado atende a todas as especificações: composição (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3, com bandgap de 1,43 eV, pontuação de estabilidade de fase de 0,743 e temperatura de decomposição de 250,5 graus Celsius. Para sermos claros quanto ao escopo, este é o resultado de um objetivo sintético com fundamentação física, e não um material que alguém tenha fabricado. É a prova de que o ciclo converge, não a alegação de uma descoberta real.

O painel do melhor material encontrado marcado como atende a todas as especificações, mostrando a composição (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3 com bandgap de 1,43 eV, pontuação de estabilidade de fase de 0,743 e temperatura de decomposição de 250,5 graus Celsius.
A composição que atende à especificação no experimento 75, a partir de um objetivo sintético: bandgap de 1,43 eV, estabilidade de 0,743, decomposição a 250,5 graus Celsius.

O comprovante: 113 registros, cadeia intacta

Cada decisão, tanto as 75 sínteses quanto os 38 bloqueios, é gravada em um registro somente de anexação, totalizando 113 registros, e exportada como um relatório de procedência da campanha mapeado para os princípios ALCOA+. Cada linha contém seu registro de data/hora (timestamp), ação, candidato, veredicto do portão, violações, justificativa e um hash SHA-256 encadeando-a ao registro anterior. O relatório indica cadeia intacta e inviolável, que é a procedência atribuível e contemporânea que um laboratório regulamentado precisa apresentar.

O relatório de procedência de campanha exportado mapeado para ALCOA+, com cabeçalho de campanha SDL-411 com 113 registros e cadeia intacta inviolável, exibindo uma tabela de decisões com colunas para registro de data/hora, ação de bloqueio ou proposta e síntese, candidato, veredicto do portão, violações, justificativa e um hash encadeando cada linha à anterior.
O relatório ALCOA+ exportado: 113 registros encadeados por hash, cadeia intacta, uma linha por decisão autônoma incluindo cada bloqueio.

O teste de violação: edite um registro e a cadeia se rompe visivelmente

A inviolabilidade só vale a pena ser afirmada se você puder vê-la em ação. Edite uma única carga útil na auditoria exportada e o verificador relatará a cadeia corrompida naquele registro, violação detectada, e declarará que a auditoria registrada foi comprovadamente alterada. A questão não é que o registro não possa ser modificado, mas que uma modificação não pode ser ocultada, o que torna a trilha defensável.

O painel de procedência ALCOA+ após o teste de violação, mostrando um aviso vermelho de que a cadeia está rompida no registro 2, violação detectada, e que a auditoria registrada foi comprovadamente alterada, ao lado do selo de 113 registros e dos controles de exportação.
O teste de violação: após um registro ser editado, a cadeia se rompe naquele registro e a auditoria alterada é sinalizada como comprovadamente adulterada.

Onde esta camada atua e onde ela não atua

É a camada de inteligência, portão de segurança e procedência sobre o seu hardware existente, e não um laboratório hospedado nem uma substituição para os seus instrumentos ou DFT.

Preocupação Um modelo de propriedades ou otimizador isolado Esta camada
Propostas quimicamente impossíveis Sintetizadas e depois pontuadas como falhas Bloqueadas por um portão determinístico antes que qualquer reagente seja gasto
Por que um candidato foi rejeitado Oculto na função de perda, se é que chega a ser registrado Identificado com base em cinco regras químicas publicadas, com dólares e horas economizados
Procedência de uma decisão automatizada Logs ad hoc, editáveis Registro ALCOA+ somente de anexação, encadeado por hash e inviolável
Quem toma a decisão de segurança Um LLM ou a própria confiança do otimizador Código simples e determinístico fora dos agentes
Eficiência amostral Varia conforme a função de aquisição 75 versus cerca de 1.491 experimentos até a especificação no objetivo oculto deste benchmark
Bloqueio de fornecedor (lock-in) em hardware e modelos Geralmente uma pilha hospedada Executa em seus instrumentos por meio de uma interface no padrão SiLA-2, com provedor de LLM intercambiável

O que esta demonstração não faz

  • O objetivo, a perovskita descoberta e cada valor de propriedade são de um benchmark sintético com fundamentação física, e não dados reais de DFT, extrações do Materials Project ou dados de laboratório. Nada foi sintetizado fisicamente; o laboratório é um simulador por trás de uma interface no padrão SiLA-2.
  • Os 20 vezes menos experimentos, a descoberta em 75 experimentos e os US$ 4.419 economizados são os números deste benchmark em um objetivo sintético oculto, e não uma garantia em ambiente aberto. Em um benchmark com 10 sementes, o ciclo convergiu em 9 de 10 execuções, e não em 10 de 10, e o próprio ciclo absorve cerca de 10 a 15 por cento de falhas robóticas.
  • A procedência ALCOA+ está presente e mapeada, mas não é validada por IQ, OQ ou PQ em relação ao seu POP (SOP). Essa qualificação faz parte do projeto de consultoria, não sendo uma garantia imediata aqui.
  • Não há drivers de instrumentos reais, nenhum substituto real de DFT ou CGCNN e nenhum agendamento de múltiplos instrumentos. Esses itens ficam para etapas posteriores.
  • Conforme fornecido, o otimizador é um GP em numpy e scipy com aquisição direcionada a alvos. O BoTorch e Ax são a substituição para produção, não o mecanismo da demonstração.
  • Não operamos um laboratório robótico hospedado nem clonamos um fornecedor existente de laboratório autônomo. A camada foi projetada para operar no hardware que você já possui.
  • Não há clientes reais, laboratórios identificados, depoimentos ou alegações de ROI. A abordagem transparente reflete o que descobrimos ao construir esta demonstração.

Perguntas frequentes dos compradores

Já compramos os robôs e um ELN. O que uma camada de laboratório autônomo realmente acrescenta?

A camada é a inteligência, o portão de segurança e o registro de procedência que se integram ao hardware que você já possui. O ciclo fechado decide o que executar a seguir e atinge uma especificação rigorosa em muito menos experimentos, um portão determinístico de gêmeo digital rejeita sínteses quimicamente impossíveis ou perigosas antes que consumam reagentes e horas-robô, e cada decisão é registrada em uma trilha de auditoria inviolável. Neste benchmark, o portão bloqueou 38 sínteses fadadas ao fracasso e economizou US$ 4.419 e 90,1 horas-robô, com zero experimentos inviáveis chegando ao robô.

Esta é uma descoberta real? Vocês realmente sintetizaram essa perovskita?

Não, e somos explícitos quanto a isso. O objetivo é um benchmark sintético com fundamentação física, e não dados reais de DFT ou de laboratório, e o laboratório é um simulador por trás de uma interface no padrão SiLA-2, portanto nada aqui foi fabricado fisicamente. O que a demonstração comprova é o mecanismo: o ciclo, o portão determinístico de segurança e a procedência auditável, que se sustentam em qualquer nível de qualidade do modelo. A composição descoberta e seus valores de propriedade são resultados de benchmark, não um resultado experimental.

Em que o portão de gêmeo digital difere das restrições já existentes em nosso otimizador bayesiano?

As restrições de um otimizador residem dentro do próprio modelo que está tentando atingir o alvo, sendo tão confiáveis quanto a autoavaliação desse modelo. Nosso portão é um código separado e determinístico que roda fora dos agentes e do substituto, verificando cada proposta em relação a cinco regras químicas publicadas: tolerância de Goldschmidt, fator octaédrico, neutralidade de carga, oxidação de Sn(II) por umidade e o teto de decomposição de precursores orgânicos. Ele retorna como viável ou bloqueado com a regra exata violada e os dólares e horas-robô evitados, de modo que uma receita fadada ao fracasso é interrompida antes mesmo de o robô vê-la.

Vocês estão executando agentes LLM em um laboratório. Como posso ter certeza de que uma alucinação não iniciará um experimento inadequado?

Porque os agentes nunca tomam a decisão. Os agentes Diretor de Laboratório e Crítico apenas narram a estratégia e sinalizam desvios, enquanto o otimizador e o portão determinístico decidem o que é executado, e nenhum dos dois depende do LLM. Sem chave de API, os agentes recorrem à narração determinística e o ciclo continua funcionando de maneira idêntica. Essa separação — agentes aconselham e o código decide — é o ponto fundamental: a confiança em um laboratório autônomo não pode depender do auto-relato do modelo sobre si mesmo.

Nossa trilha de auditoria precisa atender à FDA, à EMA e ao nosso controle de qualidade (QA). Isso é validado para GxP?

A procedência está presente e mapeada para os princípios ALCOA+: cada decisão grava um registro somente de anexação encadeado por hash, e a edição de qualquer registro corrompe visivelmente a cadeia, atendendo à exigência de procedência atribuível e contemporânea dos princípios norteadores da FDA e da EMA (FDA/EMA, 2026). Não se trata de uma validação de IQ, OQ ou PQ em relação ao seu POP (SOP), sendo essa qualificação o objetivo da consultoria, e não uma alegação pronta para uso. A demonstração exibe o registro e o teste de violação para que você possa avaliar a substância em vez de um mero formulário.

Esse número de 20 vezes menos experimentos foi selecionado a dedo (cherry-picked)?

Trata-se de uma única execução determinística, semente 411: 75 experimentos até um material que atende à especificação versus cerca de 1.491 esperados para a triagem aleatória sob o mesmo objetivo oculto, o que representa 19,9 vezes menos. Em um benchmark com 10 sementes, o ciclo teve uma média de 67 experimentos e convergiu em 9 de 10 execuções, enquanto a triagem aleatória teve sucesso em apenas 1 de 5 dentro de 1.000 e uma varredura em grade nunca atingiu a especificação. O escopo importa: estes são números de otimizador versus linha de base em um objetivo sintético, executados contra bases reproduzíveis em vez de parâmetros frágeis, não uma promessa em ambiente aberto.

Isso nos prende aos seus modelos, à sua nuvem ou a um laboratório hospedado?

Não. Nós não operamos um laboratório robótico hospedado e a camada foi projetada para operar em seus instrumentos por meio de uma interface no padrão SiLA-2. O otimizador e o portão são em numpy e scipy puros e funcionam totalmente offline sem chave de API, e o provedor de LLM é intercambiável, tendo como padrão o claude-opus-4-8. Conforme fornecido, o otimizador é um GP com aquisição direcionada a alvos, e a substituição para produção é o BoTorch e Ax, no seu próprio hardware, não no nosso.

Pesquisa Técnica

A pesquisa por trás desta demonstração — a arquitetura, o projeto de verificação e o modelo empresarial.

Coloque o portão de segurança e a trilha de auditoria onde a autonomia realmente conquista a confiança

Atinja a especificação em menos experimentos, bloqueie os inviáveis antes de serem executados e comprove cada decisão posteriormente.

Se a sua equipe está estruturando um laboratório autônomo e buscando tornar a avaliação de viabilidade confiável e a procedência defensável, gostaríamos muito de ouvir como vocês estão pensando a respeito. O problema atinge todo o setor, e as respostas também atingirão.

Avaliação de prontidão para laboratório autônomo

  • ✓ Mapeie onde sínteses fadadas ao fracasso e execuções com falha se concentram em seu fluxo de trabalho
  • ✓ Codifique suas regras de viabilidade e segurança como um portão determinístico
  • ✓ Defina a procedência ALCOA+ que seu controle de qualidade (QA) e os órgãos reguladores aceitarão
  • ✓ Delimite o objetivo de ciclo fechado em relação a linhas de base reproduzíveis

Construa conosco

  • ✓ Um otimizador por GP, ou BoTorch e Ax, com função de aquisição direcionada a alvos
  • ✓ Um portão determinístico de gêmeo digital que opera fora dos agentes
  • ✓ Uma trilha de auditoria ALCOA+ encadeada por hash e inviolável
  • ✓ Uma interface no padrão SiLA-2 para seus instrumentos existentes, sem lock-in
Redes sociais

Também publicado em