자율 소재 탐색 루프를 구축하며 발견한 지속 가능한 가치는 대리 모델이 아닌 결정론적 타당성 게이트와 감사 추적입니다.
Self Driving LabsMaterials ScienceLab Automation

완벽한 모델도 자율주행 연구실이 실패할 합성을 실행하는 것을 막지 못합니다. 저는 이를 막아내는 게이트를 구축했습니다.

Ashutosh SinghalAshutosh Singhal2026년 7월 11일12 min

우리가 만드는 것을 본 연구원들로부터 늘 같은 질문을 받곤 하며, 오랫동안 저는 그들이 원하는 방식으로 답해왔습니다. "샘플 효율성 배수(sample-efficiency multiple)가 어떻게 됩니까?" 전수 조사(brute-force screening)에 비해 루프에서 필요한 실험 수가 얼마나 더 적습니까? 이는 타당한 질문입니다. 하지만 저는 이것이 맨 앞에 내세우기에는 잘못된 질문이라는 결론에 도달했으며, 시뮬레이션된 로봇이 혼합이 채 끝나기도 전에 공기 중에서 산화되었을 레시피를 천연덕스럽게 실행하는 모습을 지켜보기 전까지는 그 이유를 온전히 이해하지 못했습니다.

저는 Ashutosh이며, Veriprajna를 운영하고 있습니다. 우리는 연구실이 이미 보유한 하드웨어 위에서 자율주행 연구실(self-driving lab)을 위한 두뇌, 안전 게이트, 그리고 출처(provenance) 레이어를 구축합니다. 호스팅 기반의 로봇 시설도 아니며, 재료 연구 그룹이 10년에 걸쳐 구입한 장비를 대체하는 것도 아닙니다. 다음에 무엇을 실행할지 결정하고, 실패할 운명의 실험을 거부하며, 규제 기관이 요구하는 종류의 기록을 유지하는 얇지만 하중을 견뎌내는(load-bearing) 소프트웨어 레이어입니다. 여러분이 직접 열어 시험해 볼 수 있는 이 데모는 veriprajna.com/ko/demos/autonomous-lab-ai에서 확인하실 수 있으며, 모델이 아니라 레이어가 진정한 제품임을 제 스스로에게 증명하고자 한 곳이 바로 이곳입니다.

모두가 내게 묻는 그 숫자는 잘못된 지표다

이 시스템을 구축하던 첫 달에는 배수(multiple)를 높이는 데 매달렸는데, 그것이 바로 이 분야가 보상하는 방식이기 때문입니다. 지금 자율주행 연구실 업계의 대화는 더 나은 대리 모델(surrogate)과 더 큰 베이즈 최적화 대 스크리닝 비율을 향한 경쟁입니다. 이해합니다. 깔끔하고 인용하기 좋은 숫자니까요. 우리 자체의 은닉 목표(hidden objective)에서, 폐루프는 무작위 스크리닝이 약 1,491회를 필요로 하는 데 반해 75회의 실험만에 규격 충족 소재에 도달하며, 대시보드는 이를 19.9배 더 적은 횟수로 보고합니다. 이는 재현 가능한 실제 기준선(baseline) 위에서 얻은 실제 결과이며, 그 결과를 확보하게 되어 기쁩니다.

하지만 저를 멈춰 서게 만든 사실이 있습니다. 모든 물성을 완벽하게 예측하는 완벽한 대리 모델이라 할지라도, 전하 불균형이 있는 합성 반응이 실행되는 것을 막을 수는 없습니다. 습한 공기와 접촉하면 산화될 조성을 거부할 수도 없습니다. 의약품 규제 기관이 인정할 기록을 생성할 수도 없습니다. 그리고 모델 자체만으로는 루프를 닫을(close the loop) 수 없습니다. 모델은 모두가 경쟁하는 영역이지만, 가장 지속 가능성이 낮은 가치를 지닌 영역이기도 합니다. 왜냐하면 모델의 성능이 좋아지는 순간, 여러분의 문제는 더 이상 예측이 아니라 제어, 안전, 그리고 입증이기 때문입니다.

더 우수한 모델이 자율 연구실을 신뢰할 수 있게 만들어주지는 않습니다. 그저 수행했어야 마땅했음을 여전히 입증할 수 없는 실험을 더 빠르게 실행하도록 만들 뿐입니다.

가장 널리 인용되는 자율 합성 연구 중 하나인 버클리의 A-Lab은 71%의 성공률을 보고했는데, 이는 시도의 약 29%가 목표 물질을 얻지 못했음을 의미합니다 (A-Lab, Nature, 2023). 연구소장의 관점에서 그 숫자를 읽어보십시오. 로봇 가동 시간과 시약의 거의 3분의 1이 아무것도 얻지 못한 실험에 낭비되었습니다. 더 우수한 획득 함수(acquisition function)가 이를 해결해주지는 못합니다. 다른 무언가가 해결해야 합니다.

실패할 운명의 실험이 실제로 치르는 비용은 얼마인가?

저는 게이트를 두 번째로 만들었는데, 결과적으로 가장 먼저 만들었어야 할 요소였습니다. 이 게이트는 에이전트 외부의 결정론적 코드에 위치하며, 최적화기가 제안하는 모든 후보는 단 하나의 시약을 건드리기 전에도 반드시 이를 통과해야 합니다. 게이트는 5가지 검사를 실행하며, 이 검사들은 제가 발명한 휴리스틱이 아니라 모두 이미 출판된 화학 이론입니다: 골드슈미트 허용 인자(Goldschmidt tolerance factor)가 페로브스카이트 형성 가능 범위를 벗어남, 팔면체 인자(octahedral factor)가 안정적 팔면체 범위를 벗어남, 전하 중성(charge neutrality)이 보상되지 않은 B자리 치환으로 인해 위반됨, 공정 습도에서의 Sn(II) 산화 위험, 그리고 유기 전구체가 분해되는 온도 이상에서의 어닐링(annealing). 후보 물질이 이 중 하나라도 위반하면, 게이트는 BLOCKED를 반환하고, 해당 규칙의 이름을 명시하며, 방금 절약한 비용과 로봇 가동 시간을 보고합니다.

차단된 페로브스카이트 후보를 보여주는 디지털 트윈 게이트 세부 정보 패널: 예측 밴드갭 2.426 eV, 상 안정성 0.155, 분해 온도 214.8 °C가 모두 목표치 미달로 플래그 처리되었고, 공정 습도에서의 Sn(II) 산화 위험으로 거부되었으며, $105의 시약과 2.33 로봇 시간이 절약되고 ALCOA+ 레코드 #111로 기록됨.
합성 전에 게이트에 의해 포착된 후보 물질. 50% 습도에서의 Sn(II) 산화 위험을 플래그 처리하고, 어차피 목표를 빗나갔을 세 가지 물성을 보여주며, 절약된 $105와 2.33 로봇 가동 시간을 기록합니다. 모든 차단 작업은 자체 ALCOA+ 영수증을 작성하며, 여기서는 레코드 #111입니다.

차단된 카드 중 하나를 처음 클릭했을 때, 논쟁의 결론이 내려졌음을 느꼈습니다. 패널이 보여주는 내용을 보십시오. 공정 습도 환경에서 Sn(II) 함량이 높은 조성인데, 해당 산화 상태의 주석이 습한 공기에서 산화되기 때문에 디지털 트윈이 이를 거부합니다. 이는 모델이 잡아냈어야 할 잘못된 예측이 아닙니다. 모델이 강제하기에는 애초에 적합한 도구가 아니었던 물리적 사실입니다. 게이트는 그 후보 단 하나에서 105달러와 2시간 남짓의 로봇 시간을 절약했고, 그 결정에 대한 영수증을 작성했습니다. 이를 전체 캠페인에 걸쳐 곱해보면 더 이상 단순한 부가 기능(nice-to-have)을 이야기하는 것이 아닙니다. 의도적으로 막아낸 29%의 낭비 누출에 대해 이야기하는 것입니다.

저는 이것이 무엇인지 명확하게 밝히고자 합니다. 인상적인 설명보다는 정직한 설명이 제게 더 중요하기 때문입니다. 이 게이트 뒤의 "연구실"은 SiLA-2 형태의 인터페이스를 갖춘 시뮬레이터이며, 그 목표는 물리적 근거를 둔 합성 벤치마크(synthetic benchmark)일 뿐, 실제 DFT나 실제 실험 데이터는 아닙니다. 우리가 물질을 직접 합성했다고 주장하는 것이 아닙니다. 실패할 화학 반응을 결정론적으로 거부하는 메커니즘이 실재하고, 검사 가능하며, 어떤 모델의 성능이 얼마나 우수하든 그와 무관하게 작동한다는 점을 말씀드리는 것입니다.

모델 스스로 자신을 감시하게 해보았습니다. 모델은 시치미를 떼고 거짓말을 했습니다.

처음부터 게이트가 결정론적이어야 한다고 생각했던 것은 아닙니다. 솔직히 저의 첫 직관은 유행을 따르는 것이었습니다. 즉, 언어 모델 에이전트가 타당성을 추론하도록 하는 방식이었습니다. 전략을 서술하는 연구소장 에이전트(Lab Director agent)와 드리프트(drift)를 감지하는 비평가 에이전트(Critic agent)가 있었기에, 실질적으로 이들에게 "이 후보가 안전하고 타당한가?"라고 묻는 것이 우아해 보였습니다. 그래서 어느 날 오후 내내 검사 대신 모델의 판단에 맡겨두었습니다.

모델은 전하 불균형 조성을 합리화했습니다. 그것도 아주 자신 있게 말입니다. B자리 치환이 왜 괜찮을 가능성이 높은지에 대해 유창한 문단을 작성해 주었지만, 그 문단은 틀렸고, 어조의 그 어디에서도 그것이 틀렸다는 낌새를 채챌 수 없었습니다. 그날 오후, 설계 원칙은 단순한 구호를 넘어 제가 결코 굽히지 않을 철칙이 되었습니다.

에이전트는 조언하고, 코드가 결정한다. 자율주행 연구실에서 이는 제약이 아닙니다. 자율 시스템이 무인으로 가동될 권리를 획득할 수 있는 유일한 길입니다.

그래서 저는 타당성과 안전성 결정을 에이전트에서 완전히 분리하여 결정론적 코드로 옮겼고, 최적화기 역시 언어 모델로부터 독립되도록 만들었습니다. 에이전트는 서술과 비평을 담당하며, API 키 없이 데모를 실행하면 결정론적 서술 모드로 대체되어 모든 기능이 여전히 정상 작동합니다. 왜냐하면 게이트와 최적화기는 모델에 전혀 의존하지 않기 때문입니다. 최적화기 자체는 특이한 것이 아니며, 과장하기보다 정직하게 밝히자면 numpy와 scipy로 작성된 타깃 지향형 ParEGO 획득 함수 기반의 가우스 과정(Gaussian-process) 대리 모델입니다. 성숙한 방식이며, 의도적으로 화려하지 않게 만들었습니다. 프로덕션 환경에서는 BoTorch와 Ax로 교체할 수 있습니다. 핵심은 결코 기발한 최적화기가 아니었습니다. 안전을 맡겨야 할 부품이 자신감 넘치는 문단으로 말하는 주체여서는 안 된다는 점이 핵심이었습니다.

내가 실제로 신경 쓰는 점수판

저는 이제 시작했을 때와는 다른 시각으로 이 점수판을 봅니다. 모든 사람의 눈길이 19.9배라는 수치로 쏠리며, 이는 분명 훌륭한 결과입니다. 하지만 R&D 책임자가 우리가 실제로 무엇을 변화시키는지 물을 때 제가 가리키는 숫자는 그 바로 옆에 있는 숫자입니다: 합성 전 38개의 실행 불가능한 후보 차단, $4,419 상당의 시약 낭비 및 90.1 로봇 가동 시간 방지, 그리고 실패할 운명의 실험 실행 0건. 동일한 은닉 목표에서 무작위 스크리닝은 단지 시간이 더 오래 걸린 것에 그치지 않고, 이 모든 자원을 남김없이 태워 없앴을 것입니다.

Crucible 대시보드 점수판: 75회 실험 실행(무작위 스크리닝 대비 19.9배 적음), 디지털 트윈으로 방지된 낭비 $4,419, 절약된 로봇 가동 시간 90시간, 38개의 실행 불가능 후보 차단, 실험 #75에서 규격 충족 달성을 표시함.
seed-411 실행의 실시간 점수판. 제가 앞세우는 숫자는 19.9배라는 배수가 아니라, $4,419와 38건의 차단입니다. 즉, 실패할 레시피를 결코 건드릴 필요가 없었던 하드웨어에서 게이트가 방지해 낸 낭비입니다.
모두의 모델이 발전함에 따라 배수의 인상적인 정도는 줄어듭니다. 하지만 게이트가 방지하는 낭비와 게이트가 남기는 기록의 가치는 더욱 높아질 뿐입니다.

루프가 하지 않은 일에 주목하십시오. 완벽을 주장하지 않았습니다. 다중 시드(multi-seed) 벤치마크 전반에서 폐루프는 10회 중 10회가 아니라 예산 내에서 10회 중 9회의 실행을 해결했으며, 주입된 10~15% 비율의 로봇 실패를 흡수합니다. 실제 로봇은 실패하기 마련이며, 그렇지 않은 척하는 것은 데모를 거짓말로 만드는 것이기 때문입니다. 감사 추적(audit trail)에 있는 기록 중 하나는 실패하여 네거티브 데이터(negative data)로 캡처된 합성입니다. 실패를 버리는 자율주행 연구실은 경계를 더 정밀하게 다듬어주는 바로 그 정보를 내던지는 것이기 때문입니다. 저는 이를 일부러 눈에 띄게 남겨두었습니다.

그리고 이 배수에는 누구도 떼어낼 수 없는 명확한 적용 범위가 있습니다. 75 대 1,491이라는 결과, 19.9배, $4,419 모두 하나의 은닉 합성 목표에서 기준선 대비 수행한 베이즈 최적화 결과입니다. 이는 엔진이 작동한다는 뒷받침 증거입니다. 이것은 오픈 월드(open-world)에서의 보증이 아니며, 루프가 기준선을 넘어서지 못했다면 저는 그 사실을 그대로 보고했을 것입니다. 제가 앞세우는 가치인 낭비 방지와 출처 추적성은 모델의 품질과 상관없이 유효합니다. 배수는 벤치마크에 의존하는 부분이기에 주의 사항을 단단히 붙여두는 것입니다.

규제 기관이 당신의 로봇을 믿어줄 것인가?

출처 레이어가 사람들을 설득하는 핵심 요소가 될 것이라고는 예상치 못했지만, 규제 기관의 감독 아래 일하는 모든 이들에게 가장 강력하게 다가가는 부분입니다. FDA와 EMA의 2026년 "신약 개발 AI 가이드 원칙(Guiding Principles for AI in drug development)"은 귀속 가능하고(attributable) 동시적인(contemporaneous) 출처를 요구합니다. 알기 쉽게 말하자면, 모든 자동화된 결정에 대해 '누가 또는 무엇이', '어떤 근거로', '어느 시점에' 내렸으며, '그 기록이 이후 변경되지 않았음을 입증할 수 있는가'를 묻는 것입니다. 더 우수한 대리 모델은 여기에 단 1인치도 더 다가가지 못합니다. 기록만이 이를 가능하게 합니다.

어젯밤에 무엇을 했는지 입증할 수 없는 자율주행 연구실은 자율적인 것이 아닙니다. 책임 소재가 불분명하며, 규제를 받는 어떤 연구실도 이를 두 번 실행하지 않을 것입니다.

따라서 시스템이 내리는 모든 결정은 합성 여부와 차단 여부를 불문하고 추가 전용(append-only) ALCOA+ 레코드가 됩니다: 타임스탬프, 선택을 내린 알고리즘, 예측된 물성과 불확실성, 근거, 게이트 판정, 그리고 측정 결과. 각 레코드는 이전 레코드와 체인으로 연결된 SHA-256 해시를 포함합니다. seed-411 캠페인 전체에서 이는 113개의 레코드(75건의 합성과 38건의 차단)에 달하며, 전체 내용을 JSON 및 렌더링된 보고서로 내보낼 수 있습니다.

'ALCOA+ mapped'라는 제목의 내보낸 캠페인 출처 보고서: 113개의 레코드, 위변조 방지(tamper-evident)를 입증하는 'CHAIN INTACT', 그리고 타임스탬프, 후보, 게이트 판정, 위반 사항, 근거, 해시가 포함된 BLOCK 및 PROPOSE_AND_SYNTHESIZE 결정 표를 보여줌.
내보낸 출처 보고서. 113건의 결정, 각 행이 이전 행과 해시 체인으로 연결되어 있으며, 모든 차단 결정에는 화학적 위반 사항과 방지된 낭비가 명시되어 있습니다. 이것이 바로 규제를 받는 연구실이 제출하는 산출물이며, 대시보드 스크린샷 따위가 아닙니다.

여기서 저는 신중해야 하며, 다른 이들이 과장하는 모습을 보아온 부분이기도 합니다. 이것은 ALCOA+ 출처 매핑(mapped)일 뿐이며, 고객의 표준 운영 절차(SOP)에 맞추어 IQ/OQ/PQ 검증을 마친 것은 아닙니다. 그러한 검증은 실제 프로젝트 수행 단계에서 이루어지는 것이며, 데모에서 체크할 수 있는 항목이 아닙니다. 제가 보여드릴 수 있는 것은 이 속성이 장식용이 아니라 실재하며 검사 가능하다는 사실입니다. 그래서 저는 레코드 하나를 수정하고 체인 검사를 다시 실행하는 변조(Tamper) 테스트를 구축했습니다.

변조(Tamper) 테스트 후의 ALCOA+ 출처 패널: 113개의 레코드와 'Chain broken at record #2, tamper detected, the filed audit is provably altered(레코드 #2에서 체인 손상됨, 변조 감지됨, 제출된 감사가 변경되었음이 입증됨)'라는 빨간색 경고를 표시함.
변조 테스트가 하나의 레코드를 수정하면 해시 체인이 정확히 해당 레코드에서 끊어집니다. 자체적인 변경을 감지할 수 없는 출처 추적은 장식에 불과합니다. 이 시스템은 변경을 감지하고 그 위치를 명시합니다.

그 테스트를 처음 실행하고 화면에 "Chain broken at record #2: tamper detected. The filed audit is provably altered"라는 문구가 출력되는 것을 보았을 때, 제가 실제로 무엇을 만들었는지 깨달았습니다. 더 빠른 최적화기가 아니었습니다. 연구실이 사후에 자율적 결정이 기록에 적힌 그대로였음을 입증할 수 있게 해주는 레이어였습니다. 그것이야말로 더 나은 모델로는 살 수 없는 것이며, 규제 기관, 감사관, 혹은 미래의 여러분 자신이 요구하게 될 핵심입니다.

자율주행 연구실 경쟁에서 빠져 있다고 생각하는 것

저는 샘플 효율성에 반대하려는 의도로 시작한 것이 아니며, 결코 그렇지 않음을 분명히 밝힙니다. 목표 달성을 위한 실험 횟수를 줄이는 것은 실질적인 가치이며 우리 루프는 이를 제공합니다. 전체 시스템을 구축하고 제 신뢰가 실제로 어디에 머무는지 관찰한 후 제가 확신하게 된 점은, 이 분야가 기술이 성숙할수록 가치가 떨어지는 단 하나의 숫자에만 집착해 왔다는 사실입니다. 모든 연구 그룹이 우수한 대리 모델을 갖추게 되면, 배수는 더 이상 차별화 요소가 되지 못합니다. 실패할 화학 반응을 거부하는 게이트와 실행된 내용을 입증하는 기록의 가치는 더욱 높아질 뿐입니다. 누군가가 무인 가동을 허용하기 전에 자율성에 반드시 필요한 부품들이기 때문입니다.

따라서 제가 회사 전체를 걸 만한 역발상적 접근법은 타당성 및 안전성 결정을 에이전트 외부의 결정론적 코드에 두고, 모든 자동화된 결정을 사후에 반드시 입증할 수 있어야 하는 대상으로 취급하는 것입니다. 모델이 나빠서가 아닙니다. 자율주행 연구실이 밤새 무인으로 가동될 수 있는지를 결정하는 질문은 예측 문제가 아니기 때문입니다. 그것은 안전의 문제이자 출처의 문제이며, 이에 필요한 것은 자신감 넘치는 문단이 아니라 코드와 해시입니다.

직접 루프를 열어 실패할 운명의 합성을 차단하고, 감사 체인을 끊어보며 동의하는지 여부를 다음 주소에서 확인하실 수 있습니다: veriprajna.com/ko/demos/autonomous-lab-ai.

글로 된 설명보다는 직접 눈으로 보고 싶으시다면, 전체 시스템이 엔드투엔드로 실행되는 모습을 여기서 확인하실 수 있습니다.

제가 끊임없이 곱씹으며 실제 자동화를 운영하는 모든 분들께 진심으로 묻고 싶은 질문이 있습니다. 오늘 밤 여러분의 연구실에서 1,000건의 실험이 무인으로 실행된다면, 내일 아침 여러분은 더 나은 모델과 입증 가능한 기록 중 어느 쪽에 손을 뻗으시겠습니까?

관련 연구

다른 채널에도 게시됨

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.