
78,000달러를 들여 답을 놓치는 법: 더 큰 스크리닝 대신 자율 실험실을 구축하는 이유
제가 처음 설계를 도왔던 자율 실험실(self-driving lab)이 실패한 것은 AI 때문이 아니었습니다. 액체 취급 장비(liquid handler) 때문이었습니다.
우리는 모두가 열광하는 부분을 만드는 데 몇 주를 쏟았습니다. 그래프 신경망을 감싼 베이지안 최적화 루프였는데, 노(furnace)에서 며칠을 기다리는 대신 밀리초 단위로 할라이드 페로브스카이트의 밴드갭을 예측할 수 있었습니다. 시뮬레이션 안에서는 아름다웠습니다. 획득 함수(acquisition function)는 체스 엔진이 수를 읽듯 조성을 골라냈습니다. 그런데 실제 실험실에 들어가 실제 장비에 연결하려 하자, 12년 된 Hamilton 액체 취급 장비 앞에서 모든 것이 딱 멈춰버렸습니다. 그 장비의 메서드 파일은 Hamilton 자체 소프트웨어가 아닌 어떤 것과도 대화하기를 거부했습니다.
그날 저는 무엇이 자율 실험실인지 실제로 이해하게 되었습니다. 그것은 영리한 모델이 아닙니다. 그것은 닫힌 루프입니다. 실험을 설계하고, 실제 하드웨어에서 실행하고, 결과를 읽고, 다음 실험을 결정하고, 반복하는 것입니다. 그리고 그 루프는 가장 약하고 가장 지루한 연결 고리만큼만 강합니다. 대개 그 연결 고리는 벤더가 아닌 누구도 자동화할 생각이 없었던 2014년산 장비 한 대입니다.
모두가 최적화기(optimizer)에 대해 이야기하고 싶어 합니다. 여러분의 실험실이 자율화될지 여부를 결정하는 것은, 15년 된 분광기가 새벽 3시에 Python 프로세스로 숫자를 되돌려줄 것인가입니다.
저는 30년 동안 산업 R&D의 주력이었던 고처리량 스크리닝(high-throughput screening)이 이제 왜 수학적으로 시대에 뒤떨어졌는지, AI가 지시하는 실험실은 그 대신 무엇을 하는지, 그리고 이런 시스템 중 하나가 여러분의 건물 안에서 실제로 작동할지를 결정하는, 화려하지 않은 엔지니어링에 대해 짚어보고 싶습니다. 이것이 우리가 지금 자율 실험실을 구축하며 다루는 문제이며, 그것을 어렵게 만드는 대부분은 학회 강연이 시사하는 것과는 전혀 다릅니다.
고처리량 스크리닝은 왜 갑자기 시대에 뒤떨어졌는가?
어떤 R&D 책임자든 신경 쓰이게 할 숫자 하나로 시작하겠습니다. 리핀스키 규칙(Lipinski's rules)—"이것이 약이 될 수 있다"의 기본 화학—을 따르는 약물 유사 저분자의 수는 10⁶⁰개로 추정됩니다. 로봇공학과 시약에 수백만 달러가 드는 대규모 고처리량 스크리닝 캠페인은 약 10⁶개의 화합물을 시험합니다.
나눗셈을 해보십시오. 여러분은 그 공간의 대략 0.000000000000000000000000000000000000000000000000000001%를 샘플링하고 있습니다. 생물학적 제제와 다원소 합금으로 밀고 들어가면 공간은 10¹⁰⁰을 향해 늘어나는데, 이는 관측 가능한 우주의 원자 수보다도 많습니다.
더 깊은 문제는 사실 커버리지조차 아닙니다. 그 밑에 깔린 가정입니다. 스크리닝은 답이 이미 선반 위 미리 합성된 라이브러리 안에 놓여 있다고 전제합니다. 진정으로 새로운 물질—무연 페로브스카이트, 고체 전해질, 새로운 MOF—의 경우, 최적의 조성은 거의 확실히 누구도 만든 적이 없습니다. 여러분은 건초더미에서 바늘을 찾는 것이 아닙니다. 태평양만큼 큰 건초더미에서, 여러분이 직접 벼려내야 하는 바늘을 찾고 있는 것입니다.
이것이 이룸의 법칙(Eroom's Law)—무어의 법칙(Moore's Law)을 거꾸로 쓴 것—의 밑에 깔린 엔진입니다. 지출이 늘어나는데도 수십 년 동안 제약 R&D 생산성이 떨어져 왔다는, 잘 문서화된 사실입니다. 이제 신약 개발은 자산당 20억 달러를 넘어서고(Deloitte, 2024), 후보 물질의 약 90%가 임상시험에서 실패하며, 제약업계의 내부수익률은 2022년 1.2%로 12년 만의 최저치로 곤두박질쳤다가, 대체로 몇몇 GLP-1 이상치의 힘으로 2024년 5.9%로 되찾아왔습니다. 무차별 대입 탐색은 이 모든 숫자에 매겨지는 세금입니다.
무차별 대입이 실제 예산에서 얼마나 드는가

10⁶⁰에 대한 추상적 이야기는 누구도 움직이지 못하므로, 이 시대착오가 실제 예산에서 어떻게 드러나는지 보겠습니다.
차세대 태양전지를 위해 특정 밴드갭과 안정성 프로파일을 지닌 무연 할라이드 페로브스카이트를 쫓는 중형 소재 실험실을 그려보십시오. 다섯 가지 후보 양이온, 여덟 가지 음이온 조합, 연속적인 화학량론 비율—10⁸개의 실현 가능한 조성이라고 부릅시다. 전통적 방법은 박사후연구원이 문헌과 지도교수의 직관에 이끌려 일주일에 서너 개에서 다섯 개의 조성을 합성하는 것입니다. 전구체, 기판 준비, 특성 분석까지 계산하면 합성당 약 150달러—여러 발주서에서 쌓여 가는 것을 지켜본 항목입니다—이니, 520개의 조성을 시험하는 데 1년에 걸쳐 78,000달러가 듭니다.
1억 개 중 520개. 이는 공간의 0.00052%이며, 그것이 찾아내는 최상의 후보는 진짜 최적점 근처 어디에도 없을 수 있습니다.
제약 쪽에서는 같은 산술이 실험대가 아니라 시계를 상대로 펼쳐집니다. 저는 똑같은 루프 논리—먼저 예측하고, 합성할 가치가 있는 후보만 합성한다—가 전통적으로 4~5년이 걸리는 전임상 작업을, Exscientia가 AI로 설계한 분자를 대략 12개월 만에 임상 1상에 올리기 위해 돌린 사이클에 더 가깝게—전임상 R&D 비용을 25~50% 낮추며—압축하는 것을 지켜봤습니다. 같은 원리이나, 분모는 훨씬 큽니다.
이제 같은 문제를 자율 실험실로 돌려봅시다. Materials Project—계산된 물질 특성의 공개 데이터베이스—의 DFT로 계산된 5만 개 페로브스카이트 구조에 그래프 신경망 대리 모델(surrogate)을 사전 학습시켜, 모델이 밴드갭과 형성 에너지를 밀리초 안에 예측할 수 있게 합니다. 그런 다음 기대 개선(Expected Improvement) 획득 함수를 사용하는 베이지안 최적화기가 두 가지 기준 중 하나로 다음 실험을 하나씩 고릅니다. 예측된 성능이 높거나, 아니면 그 지점에서 모델의 불확실성이 해소할 가치가 있을 만큼 크거나입니다. 그것은 점진적이거나 쓸모없는 데이터를 만들어냈을 수백 번의 실행을 의도적으로 피합니다.
그 시스템은 80~120회의 표적화된 실험으로, 시약비 12,000~18,000달러로 조성 공간의 상위 0.1%에 도달합니다. 같은 실험실, 같은 장비, 같은 박사후연구원—실험 수는 한 자릿수 자릿수(order of magnitude)만큼 적고, 비용은 그 일부에 불과합니다.
승리는 실험을 더 빠르게 돌리는 것이 아닙니다. 애초에 아무것도 알려주지 않을 게 뻔했던 400번의 실험을 절대 돌리지 않는 것입니다.
표적까지의 실험 수를 10~50배 줄인다는 것은 제가 지어낸 마케팅 수치가 아닙니다. 그것은 소재 문헌 전반에 걸친 베이지안 최적화와 무작위 스크리닝 사이의 일관된 격차입니다. 그리고 비용 측면에는 그 자체의 숫자가 있습니다. 2024년 ChemRxiv에 발표된 비용 정보 기반 베이지안 최적화(Cost-Informed Bayesian Optimization)는 각 실험의 가격을 나중에 생각할 부수적인 것이 아니라 획득 함수가 최적화하는 대상의 일부로 취급함으로써 최적화 비용을 최대 90%까지 줄입니다.
왜 나는 모델을 믿기를 멈추고 배관을 걱정하기 시작했는가

다시 그 Hamilton 취급 장비로 돌아갑시다.
시뮬레이션에서 완벽했던 우리 루프가 실제 하드웨어와 접촉하자마자 죽었을 때, 제 첫 직감은 틀린 것이었습니다. 저는 그것이 일회성—낡은 장비 하나와 얽힌 불운—이라고 가정했습니다. 그래서 우리는 빠른 어댑터를 작성해 그것을 절뚝거리게나마 돌아가게 하고는 넘어갔습니다. 그런데 다음 실험실에는 FluentControl을 돌리는 Tecan이 있었고, 그다음 실험실에는 제3의 방언을 쓰는 Agilent 장비가 있었으며, 같은 실험을 두 가지 호환되지 않는 형식으로 저장하는 LIMS와 ELN이 있었습니다. 모든 현장에서 모델은 첫날에는 멀쩡했고, 통합이 그 뒤의 몇 주를 잡아먹었습니다.
그때 이것이 와닿았습니다. 자율 실험실에서 AI는 아마 작업의 20%입니다. 나머지 80%는 이질적이고 흔히 오래된 장비들을 하나의 프로그래밍 가능한 단일 시스템처럼 행동하게 만드는 일입니다. 오늘날 실험실들은 사람을 인간 미들웨어로 바꿈으로써 이를 조용히 견뎌냅니다. 과학자가 분광기의 숫자를 스프레드시트로, 다시 LIMS로 다시 입력하는 것—이것이 바로 자동화가 없애기로 되어 있던, 수작업의 오류투성이 단계입니다.
정직한 해결책은 장비들에게 공통 언어를 주려는 실험실 자동화 표준인 SiLA 2입니다. 하지만 "표준"은 그것을 과장합니다. 각 장비 조합은 그 자체로 하나의 통합 프로젝트입니다. 그래서 우리는 특정 레거시 장비들—12년 된 취급 장비 포함—을 감싸기 위해 SiLA 2 드라이버 스택을 손으로 작성하기 시작했고, 그 드라이버 계층을 변명해야 할 접착 코드가 아니라 일급(first-class) 산출물로 취급했습니다. 그것이 실험실이 자율적인지 아니면 그저 데모에 불과한지를 결정하는 부분입니다.
모델 쪽에도 기다리고 있던 두 번째 기술적 겸손의 순간이 있었습니다. 화학량론 탐색이 처음으로 수십 개의 조정 가능한 매개변수를 넘어서자, 우리의 교과서적인 가우시안 프로세스 최적화기가 기어가는 속도로 느려졌습니다. 표준 GP 기반 베이지안 최적화는 O(n³)으로 확장됩니다. 약 50차원을 넘어서는 어딘가에서 그것은 그저 사용 불가능해지고, 대부분의 기성 도구가 노출하지 않는 희소 근사—SVGP, 심층 커널 학습(deep kernel learning)—로 옮겨가야 합니다. 그리고 페로브스카이트 사례에서 그토록 영리해 보였던 GNN 대리 모델은요? 차갑게(학습되지 않은 채로는) 쓸모가 없습니다. 그것의 예측이 동전 던지기를 이기려면 DFT로 계산된 500~1,000개의 구조가 필요합니다. 콜드 스타트(cold-start) 문제는 더 나은 모델을 골라서 푸는 것이 아닙니다. 어떤 사전 학습된 화학에서 미세 조정할지에 관한 도메인 전문성으로 푸는 전이 학습(transfer-learning) 문제입니다.
그중 어느 것도 브로슈어에는 없습니다. 그러나 그 전부가 프로젝트의 실제 모습입니다.
누가 또 자율 실험실을 만드는가—그리고 그들은 조용히 여러분에게 무엇을 치르게 하는가?
자율 실험실 분야는 빠르게 통합되었고, 참여자들은 실재하며 자금도 넉넉합니다. 무엇이든 서명하기 전에 각자가 실제로 무엇을 주는지 알아둘 가치가 있습니다.
Radical AI는 시드 플러스 라운드에서 5,500만 달러를, 시리즈 A에서 6,000만 달러를 조달했으며, RTX Ventures와 NVIDIA의 NVentures가 후원했습니다. 2026년 1월 호컬 주지사가 참석한 가운데 브루클린 네이비 야드 시설을 열었습니다. 그들은 수십억 개의 조성을 스크리닝하고 하루에 100건 넘는 실험을, 매일 25종 넘는 합금을 실행합니다. 인상적이며, 야금학에 맞춰져 있습니다. 함정은 구조적입니다. 여러분의 데이터는 그들의 스택 위에 놓이고, 최적화 논리는 그들의 블랙박스이지 여러분이 수정할 수 있는 것이 아닙니다. Emerald Cloud Lab은 카네기 멜론에서 200개 넘는 자동화 장비를 운영합니다—여러분은 시료를 보내고 결과를 돌려받습니다—이는 진정으로 유용하지만, 동시에 여러분의 독점 화학이 여러분의 부지를 떠난다는 뜻이고 여러분은 그들의 분석 카탈로그에 제한됩니다. Atinary, Kebotix, 새로 확장된 Lila Sciences "AI 과학 공장"—같은 형태의 트레이드오프입니다. 여러분이 자신의 워크플로를 그들의 플랫폼에 맞춥니다.
이 분야의 모든 플랫폼 벤더는 다른 이름 아래 같은 것을 여러분에게 팔고 있습니다. 그들의 최적화기, 그들의 장비, 그들의 클라우드—그리고 그 위에 세입자로 얹힌 여러분의 지적 재산입니다.
그다음으로는, 50만 달러에서 500만 달러에 실험실 전략 계약을 팔고 거의 1년이 지나서야 벤더 선정 자료를 건네는 빅4 컨설팅 회사들이 있습니다—그들은 플랫폼을 구현하지, 최적화 엔진을 만들지는 않습니다. 그리고 완전한 통제권을 주지만 생산성을 갖추기까지 1년이 걸리는 베이지안 최적화 및 GNN 팀을 여러분이 직접 꾸리도록 요구하는 자체 개발 경로가 있습니다.
거의 아무도 제공하지 않는 것은 그 중간입니다. 기존 장비와 데이터를 유지하면서, 여러분의 것인 AI 최적화 계층을 더하는 것입니다. 그 간극—직접 하기와 플랫폼 종속 사이의—은 "여러분의 화학 데이터는 우리 인프라에 상주합니다"라고 적힌 벤더 계약 조항이 신중한 R&D 책임자를 멈칫하게 만드는 바로 그 이유입니다. 그것은 또한 우리가 구축하기로 선택한 지점이기도 합니다.
실패를 잊으면 무슨 일이 벌어지는가
제가 거의 모든 피치에서 꺼내는, 버클리 A-Lab의 숫자가 하나 있습니다. 그것이 올바른 방향을 갈라 보여주기 때문입니다. A-Lab은 17일 만에 41개의 새로운 물질을 합성했습니다—획기적인 자율 성과입니다. 그 합성 성공률은 71%였습니다.
기업의 자리에서 보면, 그 71%는 그 여집합으로 읽힙니다. 시도의 29%가 실패했습니다—막힌 피펫, 센서 드리프트, 열화된 시약, 온도에 도달하지 못한 노. 학술적 개념 증명으로서는 훌륭합니다. 규제받는 제약 라인으로서는, 그 29%는 숨겨야 할 낭비가 아닙니다. 그것은 여러분이 법적으로 보관해야 할 데이터입니다.
이곳이 제가 가장 값비싼 실수들이 벌어지는 것을 지켜본 지점이며, 화학과는 아무 상관이 없습니다. FDA의 데이터 무결성 표준인 ALCOA+는 기록이 귀속 가능(Attributable), 판독 가능(Legible), 동시 기록(Contemporaneous), 원본(Original), 정확(Accurate)할 것을 요구합니다—그리고 완전(Complete)할 것도요. 완전함이란 성공한 실행뿐 아니라 실패한 실험도 함께 포착됨을 의미합니다. 대부분의 자율 실험실 소프트웨어는 실패한 실행을 조용히 바닥에 흘려버립니다. 연구 실험실에서는 아무도 눈치채지 못합니다. GxP 환경에서는 그 누락이 바로 누락된 기록을 지적하는 CDER 데이터 무결성 경고 서한을 낳는 지적 사항입니다.
그것은 가상의 압박이 아닙니다. CDER 경고 서한은 2025 회계연도에 50% 급증했으며, 데이터 무결성 문제가 지배적인 지적 사항 중 하나였습니다. FDA는 2025년 초 Tyche Industries와 Jagsonpal Pharmaceuticals 같은 회사들에 무결성 서한을 보냈습니다. 그리고 2026년 1월 FDA와 EMA는 데이터 거버넌스, 수명주기 관리, 인간 감독을 중심으로 한 신약 개발에서의 우수 AI 관행을 위한 10가지 지도 원칙을 공동 발표했습니다. 그래서 우리가 규제받는 실험실을 위한 루프를 구축할 때, 막힌 피펫으로 인한 모든 실패를 타임스탬프와 출처(provenance)와 함께 포착하는 감사 추적(audit trail)은 우리가 마지막에 덧붙이는 기능이 아닙니다. 그것은 우리가 첫 줄부터 그 주위로 루프를 설계하는 제약입니다.
"플랫폼들이 그냥 이걸 하지 않을까?"—그리고 사람들이 제게 묻는 다른 것들
제가 가장 많이 듣는 질문은 자금이 넉넉한 플랫폼들이 이 필요를 그냥 흡수해버리지 않을까 하는 것입니다. 그들은 기꺼이 세입자가 되려는 실험실들을 흡수할 것입니다. 그들은 20년치 독점 데이터와, 이미 값을 치른 장비로 가득 찬 건물과, 자사의 IP가 남의 클라우드 위에 놓이는 것을 받아들이지 않을 이사회를 가진 중형 실험실은 섬기지 않을 것입니다. 그 두 필요는 구조적으로 상반되며, 자금이 그것들을 화해시키지 못합니다.
두 번째 질문은 AI가 믿을 만큼 성숙했는가입니다. 이 분야 자체의 벤치마크는 모델링이 도착했다고 말합니다. 2026년 Matbench Discovery 결과에서 45개 모델이 순위가 매겨졌고, 최고 모델인 PET-OAM-XL은 F1 0.924와 6배가 넘는 발견 가속 계수(discovery acceleration factor)를 달성했습니다. 2025년 중반 Nature Chemical Engineering에 발표된 NC State의 흐름 구동 자율 실험실 기법은 이전 접근법보다 10배 많은 데이터를 수집했습니다. 과학은 준비되어 있습니다. 상품화되지 않은 것은 그것을 여러분의 장비에, 여러분의 컴플라이언스 체제 아래에 배선하는 일입니다.
세 번째 질문은 조용한 것입니다. 이것은 그저 대형 제약사만을 위한 것인가? 아닙니다. 경제학은 R&D 예산이 공간의 0.0005%를 탐색하는 데 78,000달러짜리 1년을 감당할 수 없고, 어느 플랫폼을 사야 할지 듣기 위해 500만 달러짜리 컨설팅 수표를 쓸 수 없는 중형 소재 및 생명과학 실험실에 가장 세게 물어뜯습니다.
아무도 슬라이드에 넣지 않는 부분
저는 자율 실험실의 낭만—밤새 피펫팅하는 로봇, 분자를 꿈꾸는 AI—이 이 분야에 해를 끼친다고 생각하게 되었습니다. 그것은 낭만을 팔고 일을 숨깁니다. 이런 프로젝트 대부분이 정체되는 이유는 최적화기가 충분히 영리하지 못해서가 아닙니다. 아무도 액체 취급 장비를 위한 SiLA 2 드라이버를 몇 주씩 작성하거나, 실패한 실험을 기록하는 감사 추적을 만들거나, 대리 모델을 올바른 도메인 화학으로 콜드 스타트 너머까지 미세 조정하는 데 시간을 쓰고 싶어 하지 않았기 때문입니다.
그 화려하지 않은 일이 바로 그 일입니다. 그것이 우리가 최적화 엔진, 장비 통합, 닫힌 루프 아키텍처를 하나의 시스템으로 구축하는 이유입니다. 바로 우리 앞의 그 실험실을 위해—여러분의 장비, 여러분의 소재, 여러분의 데이터는 여러분의 것으로 남습니다.
에디슨은 그의 시대에 이론이 실험에 뒤처졌기 때문에 수천 개의 필라멘트를 손으로 시험했습니다. 2026년에 그 변명은 사라졌습니다. 우리는 합성하기 전에 예측할 수 있고, 400개 중 실행할 가치가 있는 단 하나의 실험을 고를 수 있으며, 실험실이 스스로 답을 향해 돌아가게 할 수 있습니다. 탐색을 계속 무차별 대입하는 실험실들은 철저한 것이 아닙니다. 그들은 그림의 0.0005%를 들여다보는 데 박사후연구원의 1년 전체를 지불하면서 그것을 성실함이라고 부르고 있는 것입니다.


