Autonomous Lab AI · 자율주행 소재 탐색

로봇은 시작하기도 전에 실패할 운명의 합성을 밤새도록 실행할 수 있습니다. 당사는 이를 거부하는 결정론적 게이트와 그 이유를 입증하는 감사 추적을 구축했습니다.

자율주행 연구실이 실패하는 이유는 최적화기가 취약해서가 아닙니다. 실행하는 실험의 상당수가 레시피의 첫 줄부터 화학적으로 불가능하고, 사후에 이를 전혀 입증할 수 없기 때문에 실패합니다. 본 벤치마크에서 당사의 폐루프 Design-Make-Test-Analyze 루프는 무작위 스크리닝이 약 1,491회의 실험을 필요로 하는 엄격한 사양에 단 75회의 실험만으로 도달합니다. 그동안 디지털 트윈 안전 게이트는 시약이나 로봇 시간이 소모되기 전에 실행 불가능한 모든 합성을 차단하고, 모든 결정을 위변조 방지 ALCOA+ 기록에 서명합니다. 에이전트는 조언하고, 코드가 결정합니다.

$4,419

디지털 트윈 게이트가 38건의 실패할 합성을 차단하고 90.1 로봇 시간을 절약하여 방지한 시약 낭비

시드 411 벤치마크 실행, 합성 목적 함수

20× 감소

동일한 은닉 목적 함수에서 무작위 스크리닝의 약 1,491회 대비 사양을 충족하는 소재까지 75회 실험

시드 411 벤치마크 실행, 19.9배 감소

113

해시 체인으로 연결된 ALCOA+ 기록, 결정당 1건, 위변조 방지. 하나를 수정하면 체인이 끊어집니다

시드 411 벤치마크 실행, 75회 합성 및 38회 차단

18차원 무연(lead-free) 페로브스카이트 조성 및 공정 탐색에 대한 메커니즘의 실행 가능한 데모입니다. 최적화기와 안전 게이트는 API 키 없이 numpy 및 scipy에서 완전히 실행되며, 두 어드바이저 에이전트만이 모델을 호출할 수 있는 유일한 부분입니다.

자율주행 연구실 예산의 대부분은 화학적으로 이미 배제된 사실을 증명하는 데 쓰입니다

병목은 대리 모델이 아닙니다. 모델이 애초에 제안하지 말았어야 할 실패할 운명의 실험들과, 나중에 이를 전혀 입증할 수 없다는 사실입니다.

버클리의 A-Lab은 71%의 성공률을 보고했는데, 이는 시도의 약 29%가 목표를 달성하지 못했음을 의미합니다(A-Lab, Nature, 2023). 스스로 작동하는 연구실에서 이러한 실패 비율은 단순한 수율 손실에 그치지 않습니다. 로봇이 움직이기도 전에 이미 전하 불균형이거나, 기하학적으로 불안정하거나, 화학적으로 위험했던 합성에 시약이 투입되고 로봇 시간이 예약되며 분석 기기 시간이 낭비된 것입니다.

탐색 공간은 상황을 더욱 악화시킵니다. 이 정도 규모의 페로브스카이트 조성 및 공정 공간은 그 어떤 스크리닝 예산보다도 천문학적으로 넓기 때문에, 순수 스크리닝은 전략이 아니라 복권에 불과합니다. 본 벤치마크에 대한 별도의 실현 가능성 조사에서는 80,000개 후보 중 8개라는 0.01%의 무작위 적중률이 확인되었으며, 이는 스크리닝만으로 첫 번째 목표에 도달하려면 약 10,000회의 실험이 필요함을 시사합니다. 더 나은 획득 함수(acquisition function)는 문제의 이러한 절반을 해결하는 데 도움이 됩니다.

하지만 나머지 절반에 대해서는 아무것도 하지 못합니다. 물성 모델은 아무리 뛰어나도 합성을 시도하는 것이 안전한지 여부를 결정할 수 없으며, 규제 기관이나 내부 QA가 인정할 수 있는 기록을 생성할 수 없습니다. 신약 개발 분야의 AI에 대한 FDA 및 EMA 기본 원칙은 출처(provenance)가 귀속 가능(attributable)하고 동시적(contemporaneous)이어야 함을 명시하고 있습니다(FDA/EMA, 2026). 실현 가능성과 감사 가능성은 모델이 전혀 다루지 못하는 영역이며, 바로 이것이 당사가 해결하고자 한 두 가지 격차입니다.

폐루프가 제안하고, 에이전트 외부의 결정론적 게이트가 실행 여부를 결정합니다

단계별로 표시되는 단일 Design-Make-Test-Analyze 사이클입니다. 실현 가능성 결정은 모델이 아닌 순수 코드에 존재합니다.

이 루프는 18차원 무연 페로브스카이트 공간을 탐색합니다: Cs, MA, FA 양이온 비율, Sn, Ge, Bi B-자리 치환, I, Br, Cl 할로겐화물 비율 및 공정 변수. 목표 지향적 ParEGO 방식의 획득 함수를 갖춘 가우스 과정(GP) 대리 모델이 60건의 기록으로 구성된 과거 픽스처로부터 콜드 스타트하여 다음 후보를 제안합니다. 그런 다음 모든 제안은 합성이 이루어지기 전에 게이트를 통과하므로, 레시피와 로봇 사이에 서 있는 것은 최적화기의 신뢰도가 아니라 바로 이 게이트입니다.

GP 대리 모델(제안) → 디지털 트윈 게이트(실행 가능 또는 차단, 순수 코드) → SiLA-2 형태의 합성 및 특성 분석(시뮬레이션) → 대리 모델 분석 및 업데이트 → ALCOA+ 기록(해시 체인 연결). Lab Director 및 Critic 에이전트는 결코 결정하지 않고 나란히 해설하며 드리프트를 표시합니다.

결정론적 신뢰 코어

디지털 트윈 게이트는 언어 모델 외부에 위치하는 영역입니다. 제안된 모든 후보는 시약을 소비하기 전에 실제 발표된 5가지 화학 규칙에 대해 검증을 거치며, 게이트는 위반된 정확한 규칙과 방지된 시약 예산 및 로봇 시간과 함께 실행 가능 또는 차단 결과를 반환합니다. 이는 순수한 numpy 및 scipy 코드이며, 에이전트 및 대리 모델 외부에 위치하여 핵심적인 결정을 담당합니다. 실패할 운명의 레시피는 로봇이 이미 실행한 뒤에 발견되는 것이 아니라 바로 여기서 차단됩니다.

조언으로 제한된 에이전트

코어 위에서 두 에이전트가 읽고 소통합니다. Lab Director는 캠페인 전략을 설명하고, Critic은 루프 내 검증자로서 드리프트나 지연을 독립적으로 표시합니다. LLM_PROVIDER 설정을 통해 제공자를 교체할 수 있으며 기본값은 claude-opus-4-8입니다. 키가 없으면 결정론적 해설로 폴백하므로 데모는 항상 실행됩니다. 최적화기와 게이트는 결코 LLM에 의존하지 않습니다. 에이전트는 조언하고, 코드가 결정합니다.

게이트가 시행하는 5가지 실현 가능성 검사

검사항목 감지 대상 근거
골드슈미트 허용 인자 페로브스카이트 형성능 윈도우를 벗어난 조성. 게이트는 0.78~1.05의 스크리닝 대역을 사용합니다. 페로브스카이트 결정 화학
팔면체 인자 0.41~0.90의 안정 팔면체 윈도우를 벗어난 반경 비. 페로브스카이트 결정 화학
전하 중성 보상되지 않은 B-자리 전하(예: Bi(III) 치환으로 인한 경우). 이온 전하 균형
Sn(II) 산화 위험 습한 공기에서 산화되어 공정 습도에서 안전하지 않고 실패가 불가피한 Sn(II). 주석-할로겐화물 안정성
분해 한계 온도 MA 및 FA 양이온이 분해되는 온도(약 190°C) 이상의 어닐링. 전구체 열안정성

지속적인 가치는 더 나은 대리 모델이 아니라 안전 게이트와 감사 추적입니다. 완벽한 물성 모델이라 할지라도 전하 불균형이나 산화 위험이 있는 합성의 실행을 막을 수 없으며, 규제 기관이 인정할 만한 기록을 생성할 수 없습니다. 최적화기는 해당 제어 계층 내부에서 교체 가능한 하나의 구성 요소일 뿐이며, 이것이 모델이 발전하더라도 이 접근 방식이 도태되지 않는 이유입니다. 기본 탑재된 최적화기는 목표 지향적 획득 함수를 갖춘 numpy 및 scipy GP이며, 프로덕션 교체 대상은 BoTorch 및 Ax입니다.

화면상의 실행 과정

아래의 모든 수치는 단일 결정론적 벤치마크 캠페인(시드 411)의 결과이며, 하드코딩되지 않고 런타임에 실시간으로 계산됩니다. 목적 함수는 실제 DFT나 실험실 데이터가 아닌 물리적 원리에 기반한 합성 벤치마크이며, 실험실은 SiLA-2 형태 인터페이스 뒤의 시뮬레이터입니다. 여기에 물리적으로 합성된 것은 없습니다.

스코어보드: 루프가 소비한 것과 절약한 것

폐루프는 동일한 은닉 목적 함수에서 무작위 스크리닝이 예상하는 약 1,491회보다 19.9배 적은 실험을 사용하여 75번째 실험에서 목표 사양에 도달합니다. 이와 함께 스코어보드는 속도보다 더 중요한 수치들을 추적합니다: 4,419달러(USD)의 시약 낭비 방지, 90 로봇 시간 절약, 합성 전 실행 불가능한 38개 후보 차단, 사양 상태 '사양 충족(spec met)'. 효율성은 실재하지만, 방지된 낭비와 출처 추적성이야말로 모델의 품질에 관계없이 유지되는 가치입니다.

실행된 75회 실험(무작위 스크리닝의 약 1,491회 대비 19.9배 감소), 디지털 트윈으로 방지된 4,419달러의 낭비, 절약된 90 로봇 시간, 합성 전 차단된 38개의 실행 불가능 후보, 75번째 실험에서의 사양 충족 상태를 보여주는 실시간 스코어보드.
스코어보드: 75회 실험, 무작위 대비 19.9배 감소, $4,419 및 90 로봇 시간 절약, 38개 실행 불가능 차단, 75번째 실험에서 사양 충족.

차별화 요소: 로봇에 도달하기 전에 차단된 실패할 레시피

차단 사례 1건에 대한 상세 내용입니다. 제안된 후보는 공정 습도에서 Sn(II) 산화 위험이 있으며, 예측된 밴드갭, 상 안정성 및 분해 온도가 모두 목표 범위를 벗어납니다. 게이트는 합성 전에 이를 거부하여 105달러의 시약과 2.33 로봇 시간을 절약하고, 거부 사실을 해시 체인 ALCOA+ 기록으로 작성합니다. 최적화기는 결정론적 화학이 이미 알고 있던 사실을 알아내느라 로봇 시간을 단 1시간도 낭비하지 않습니다.

합성 전 차단됨(blocked before synthesis)으로 표시되고, 예측 밴드갭, 상 안정성, 분해 온도가 모두 목표 범위 밖으로 표시되며, 공정 습도에서의 Sn(II) 산화 위험을 사유로 105달러의 시약과 2.33 로봇 시간이 절약되었음을 나타내는 차단 후보 상세 패널 및 111번 기록에 대한 해시 체인 ALCOA+ 영수증.
단일 차단 사례: 목표 범위 밖의 예측 물성, 명시된 Sn(II) 산화 위험, 합성 전 $105 및 2.33 로봇 시간 절약.

화학적 사유를 각각 명시한 38건의 차단

단일 차단의 성공은 우연이 아니라 일관된 패턴입니다. 전체 실행 과정에서 게이트는 합성 전 38개의 실행 불가능한 후보를 차단했으며, 각 후보마다 Sn(II) 산화 위험, 보상되지 않은 B-자리로 인한 전하 중성 위반, 형성능 윈도우를 벗어난 골드슈미트 허용 인자 등 위반한 물리화학적 법칙을 절약된 비용 및 로봇 시간과 함께 명시합니다. 차단을 통해 총 4,419달러와 90 로봇 시간의 낭비가 방지되었으며, 실행 불가능한 합성은 단 1건도 수행되지 않았습니다.

합성 전에 감지된 38개의 실행 불가능 후보를 보여주는 디지털 트윈 차단 전체 목록. 각 행에는 Sn(II) 산화 위험, 전하 중성 위반, 형성능 윈도우 밖의 골드슈미트 허용 인자 등의 위반 사항과 후보당 절약된 비용 및 로봇 시간이 명시되며, 총 4,419달러와 90 로봇 시간의 낭비 방지가 표시됩니다.
명시된 화학적 위반 사항 및 절약된 시약 예산과 로봇 시간이 함께 표시된 38건의 모든 차단 내역(단 한 건도 합성되지 않음).

목표 사양 박스로 유도되는 루프

소재 발견 맵은 루프가 시뮬레이션에서 합성한 각 소재를 밴드갭 대비 상 안정성 공간에 플롯하고 분해 온도로 색상을 표시하며, 점선 상자는 목표 윈도우(높은 안정성을 지닌 1.2~1.5 eV의 밴드갭)를 나타냅니다. 초기 포인트들은 흩어져 있지만, 대리 모델이 학습함에 따라 후기 포인트들은 점선 상자 쪽으로 군집화되고 최적의 소재가 그 안에 안착합니다. 이는 최적화기가 제 역할을 수행한 결과이지만, 게이트가 통과를 허용한 후보들에 대해서만 작동한 것입니다.

소재 발견 맵: x축의 밴드갭과 y축의 상 안정성에 따라 플롯되고 분해 온도로 색상이 지정된 합성 소재 산점도. 좌측 상단 영역에 점선으로 된 목표 사양 상자가 있고 해당 목표 윈도우 내에 최적의 소재가 밝은 점으로 표시됨.
밴드갭 대 상 안정성: 합성된 포인트들이 점선 목표 상자를 향해 유도되며, 최적 소재가 그 안에 안착합니다.

75번째 실험에서 도출된 사양 충족 소재

발견된 최적의 소재는 모든 사양을 충족합니다: 조성 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3, 밴드갭 1.43 eV, 상 안정성 점수 0.743, 분해 온도 250.5°C. 범위를 명확히 하자면, 이는 물리적 원리에 기반한 합성 목적 함수의 결과물일 뿐 실제로 제작된 소재는 아닙니다. 이는 루프가 수렴한다는 증거이며, 실제 발견을 주장하는 것은 아닙니다.

모든 사양 충족(meets every spec)으로 표시된 발견된 최적 소재 패널: 조성 (Cs0.46MA0.22FA0.31)(Sn0.69Ge0.31)(I0.73Br0.21Cl0.06)3, 밴드갭 1.43 eV, 상 안정성 점수 0.743, 분해 온도 250.5°C 표시.
합성 목적 함수로부터 도출된 75번째 실험의 사양 충족 조성: 밴드갭 1.43 eV, 안정성 0.743, 분해 온도 250.5°C.

영수증: 113건의 기록, 온전한 체인

75회의 합성과 38회의 차단을 포함한 모든 결정은 총 113건의 추가 전용(append-only) 레코드에 기록되며, ALCOA+ 원칙에 매핑된 캠페인 출처 보고서로 내보내집니다. 각 행에는 타임스탬프, 조치, 후보, 게이트 판정, 위반 사항, 근거, 그리고 이전 레코드와 연결하는 SHA-256 해시가 포함됩니다. 이 보고서는 '체인 온전함(chain intact)' 및 '위변조 방지' 상태를 나타내며, 이는 규제 대상 연구실이 제출해야 하는 귀속 가능하고 동시적인 출처 기록입니다.

ALCOA+에 매핑되어 내보낸 캠페인 출처 보고서(캠페인 SDL-411 제목, 113건의 기록, 체인 온전함 및 위변조 방지 표시): 타임스탬프, 차단 또는 제안 후 합성 조치, 후보, 게이트 판정, 위반 사항, 근거, 각 행을 이전 행과 연결하는 해시 열을 포함한 결정 테이블 표시.
내보낸 ALCOA+ 보고서: 해시 체인으로 연결된 113건의 기록, 온전한 체인, 모든 차단을 포함하여 자율적 결정당 1개 행.

위변조 테스트: 레코드 하나를 수정하면 체인이 눈에 띄게 끊어집니다

위변조 방지 기능은 실제로 작동하는 모습을 볼 수 있을 때만 의미가 있습니다. 내보낸 감사 기록에서 단 하나의 페이로드만 수정해도 검증기는 해당 레코드에서 체인이 끊어졌음을 보고하고 위변조를 감지하며 제출된 감사가 명백히 변조되었음을 알립니다. 핵심은 레코드를 변경할 수 없다는 것이 아니라 변경 사실을 숨길 수 없다는 점이며, 바로 이것이 감사 추적을 방어 가능하게 만듭니다.

위변조 테스트 후의 ALCOA+ 출처 패널: 113개 레코드 배지 및 내보내기 컨트롤 옆에 2번 레코드에서 체인이 끊어짐, 위변조 감지됨, 제출된 감사가 명백히 변조되었음을 알리는 빨간색 경고 표시.
위변조 테스트: 한 레코드가 수정된 후 해당 레코드에서 체인이 끊어지고 변조된 감사가 명백히 위변조된 것으로 플래그 지정됩니다.

이 계층이 위치하는 영역과 그렇지 않은 영역

이는 호스팅형 연구실이나 기존 기기 또는 DFT의 대체재가 아니라, 기존 하드웨어 위에 구축되는 두뇌, 안전 게이트 및 출처 추적 계층입니다.

고려사항 물성 모델 또는 최적화기 단독 본 계층
화학적으로 불가능한 제안 합성 후 실패로 채점됨 시약이 소모되기 전에 결정론적 게이트에 의해 차단됨
후보가 거부된 사유 기록되더라도 손실(loss) 속에 묻힘 발표된 5가지 화학 규칙에 따라 명시되며, 절약된 비용 및 시간 기록
자동화된 결정의 출처 추적성 수정 가능한 임시(ad hoc) 로그 추가 전용, 해시 체인 ALCOA+ 기록, 위변조 방지
안전 판단의 주체 LLM 또는 최적화기 자체의 신뢰도 에이전트 외부의 순수 결정론적 코드
샘플 효율성 획득 함수에 따라 달라짐 본 벤치마크의 은닉 목적 함수에서 사양 도달까지 약 1,491회 대비 75회 실험
하드웨어 및 모델 종속(락인) 주로 호스팅형 스택 SiLA-2 형태의 인터페이스를 통해 귀사의 기기에서 실행, LLM 제공자 교체 가능

본 데모가 수행하지 않는 작업

  • 목적 함수, 발견된 페로브스카이트 및 모든 물성 값은 물리적 원리에 기반한 합성 벤치마크이며, 실제 DFT, Materials Project 데이터 또는 실험실 데이터가 아닙니다. 물리적으로 합성된 것은 없으며, 실험실은 SiLA-2 형태 인터페이스 뒤의 시뮬레이터입니다.
  • 20배 적은 실험, 75회 실험에서의 발견, 4,419달러 절약은 은닉 합성 목적 함수에 대한 본 벤치마크의 수치이며 개방형 환경에서의 보장이 아닙니다. 10개 시드 벤치마크에서 루프는 10회 중 10회가 아닌 9회의 실행을 해결했으며, 루프 자체는 약 10~15%의 로봇 결함을 흡수합니다.
  • ALCOA+ 출처 추적성은 구현 및 매핑되어 있으나 귀사의 SOP에 따른 IQ, OQ 또는 PQ 밸리데이션을 거친 것은 아닙니다. 해당 적격성 평가는 실제 도입 프로젝트의 범위이며 여기서 주장하는 바가 아닙니다.
  • 실제 기기 드라이버, 실제 DFT 또는 CGCNN 대리 모델, 다중 기기 스케줄링은 포함되어 있지 않으며 향후 과제로 남겨져 있습니다.
  • 기본 제공되는 최적화기는 목표 지향적 획득 함수를 갖춘 numpy 및 scipy GP입니다. BoTorch 및 Ax는 데모 엔진이 아닌 프로덕션 교체 대상입니다.
  • 당사는 호스팅형 로봇 연구실을 운영하지 않으며 기존의 자율주행 연구실 벤더를 복제하지 않습니다. 본 계층은 귀사가 이미 보유한 하드웨어 위에 구축되도록 설계되었습니다.
  • 실제 고객, 명시된 연구실, 추천 후기 또는 주장된 ROI는 존재하지 않습니다. 본 데모를 구축하면서 발견한 사실을 솔직하게 제시하는 것이 목적입니다.

구매자가 자주 묻는 질문

저희는 이미 로봇과 ELN을 구매했습니다. 자율주행 랩 계층이 실제로 추가해 주는 것은 무엇인가요?

본 계층은 귀사가 이미 보유한 하드웨어 위에 탑재되는 두뇌, 안전 게이트 및 출처 기록입니다. 폐루프는 다음에 실행할 작업을 결정하고 훨씬 적은 수의 실험으로 까다로운 사양에 도달하며, 결정론적 디지털 트윈 게이트는 화학적으로 불가능하거나 위험한 합성이 시약과 로봇 시간을 소모하기 전에 이를 거부하고, 모든 결정은 위변조 방지 감사 추적에 기록됩니다. 본 벤치마크에서 게이트는 실패할 38건의 합성을 차단하고 4,419달러와 90.1 로봇 시간을 절약했으며, 실행 불가능한 실험은 단 1건도 로봇에 전달되지 않았습니다.

이것이 실제 발견인가요? 해당 페로브스카이트를 실제로 합성했나요?

아니요, 당사는 이에 대해 명확히 밝힙니다. 목적 함수는 실제 DFT나 실험실 데이터가 아닌 물리적 원리에 기반한 합성 벤치마크이며, 실험실은 SiLA-2 형태 인터페이스 뒤의 시뮬레이터이므로 여기에 물리적으로 제작된 것은 없습니다. 본 데모가 입증하는 것은 모델의 품질과 무관하게 유지되는 메커니즘, 루프, 결정론적 안전 게이트 및 감사 가능한 출처 기록입니다. 발견된 조성과 물성 값은 실험 결과가 아닌 벤치마크 출력값입니다.

디지털 트윈 게이트는 베이지안 최적화기에 이미 포함된 제약 조건과 어떻게 다른가요?

최적화기의 제약 조건은 목표를 달성하려는 동일한 모델 내부에 존재하므로, 해당 모델의 자체 보고 수준만큼만 신뢰할 수 있습니다. 당사의 게이트는 에이전트 및 대리 모델 외부에서 실행되는 별도의 결정론적 코드이며, 골드슈미트 허용 인자, 팔면체 인자, 전하 중성, Sn(II) 습도 산화, 유기 전구체 분해 한계 온도라는 5가지 발표된 화학 규칙에 대해 모든 제안을 검증합니다. 위반된 정확한 규칙과 방지된 비용 및 로봇 시간과 함께 실행 가능 또는 차단 결과를 반환하므로, 실패할 레시피는 로봇이 확인하기도 전에 차단됩니다.

연구실에서 LLM 에이전트를 실행하고 계십니다. 환각(할루시네이션)으로 인해 잘못된 실험이 시작되지 않는다는 것을 어떻게 확신할 수 있나요?

에이전트가 결코 결정을 내리지 않기 때문입니다. Lab Director 및 Critic 에이전트는 전략을 해설하고 드리프트를 표시할 뿐이며, 최적화기와 결정론적 게이트가 실행할 작업을 결정하고 둘 다 LLM에 의존하지 않습니다. API 키가 없으면 에이전트는 결정론적 해설로 폴백하며 루프는 여전히 동일하게 실행됩니다. 에이전트는 조언하고 코드가 결정한다는 이러한 분리가 핵심입니다. 자율주행 연구실에 대한 신뢰는 모델 자체의 자기 보고에 의존할 수 없습니다.

저희 감사 추적은 FDA, EMA 및 내부 QA를 만족해야 합니다. 이것은 GxP 밸리데이션을 받았나요?

출처 추적성은 구현되어 ALCOA+ 원칙에 매핑되어 있습니다. 모든 결정은 추가 전용 해시 체인 레코드에 작성되며, 레코드를 수정하면 체인이 눈에 띄게 끊어지는데, 이는 FDA 및 EMA 기본 원칙이 요구하는 귀속 가능하고 동시적인 출처 기록입니다(FDA/EMA, 2026). 이는 귀사의 SOP에 따른 IQ, OQ 또는 PQ 밸리데이션을 거친 것은 아니며, 해당 적격성 평가는 도입 프로젝트의 영역이지 즉시 제공된다고 주장하는 것이 아닙니다. 데모는 단순한 체크박스가 아닌 실질적인 내용을 판단하실 수 있도록 기록과 위변조 테스트를 보여줍니다.

실험 횟수가 20배 적다는 수치는 선별된(cherry-picked) 결과인가요?

이는 시드 411의 단일 결정론적 실행 결과입니다. 동일한 은닉 목적 함수에서 무작위 스크리닝의 예상치인 약 1,491회 대비 사양 충족 소재까지 75회 실험으로 19.9배 적습니다. 10개 시드 벤치마크 전체에서 루프는 평균 67회 실험을 기록하고 10회 중 9회 성공한 반면, 무작위 스크리닝은 1,000회 내에서 5회 중 1회만 성공했고 그리드 스윕은 사양에 전혀 도달하지 못했습니다. 범위를 인식하는 것이 중요합니다. 이는 조작된 가상의 대상이 아닌 재현 가능한 기준선 대비 합성 목적 함수에서 측정한 최적화기 대 기준선 수치이며, 개방형 환경에 대한 약속이 아닙니다.

이로 인해 귀사의 모델, 클라우드 또는 호스팅형 랩에 종속(lock-in)되나요?

아닙니다. 당사는 호스팅형 로봇 랩을 운영하지 않으며, 본 계층은 SiLA-2 형태의 인터페이스를 통해 귀사의 기기 위에 탑재되도록 설계되었습니다. 최적화기와 게이트는 순수 numpy 및 scipy로 작성되어 API 키 없이 완전한 오프라인으로 실행되며, LLM 제공자는 claude-opus-4-8을 기본값으로 교체 가능합니다. 기본 제공되는 최적화기는 목표 지향적 획득 함수를 갖춘 GP이며, 프로덕션 교체 대상은 당사가 아닌 귀사의 하드웨어에서 실행되는 BoTorch 및 Ax입니다.

기술 연구

본 데모의 기반이 되는 연구 — 아키텍처, 검증 설계 및 엔터프라이즈 청사진.

자율성이 진정한 신뢰를 얻는 곳에 안전 게이트와 감사 추적을 배치하십시오

더 적은 실험으로 사양에 도달하고, 실패할 실험은 실행 전에 차단하며, 사후에 모든 결정을 입증하십시오.

귀사의 팀이 자율주행 연구실을 구축 중이며 실현 가능성 판단을 신뢰할 수 있게 만들고 출처 추적성을 방어 가능하게 확보하는 방법을 고민하고 계시다면, 귀사의 견해를 꼭 듣고 싶습니다. 이는 업계 전반의 문제이며 그 해답 또한 그러할 것입니다.

자율주행 연구실 준비도 평가

  • ✓ 워크플로에서 실패할 합성과 실패한 실행이 집중되는 지점 파악
  • ✓ 실현 가능성 및 안전 규칙을 결정론적 게이트로 인코딩
  • ✓ 내부 QA 및 규제 기관이 인정할 ALCOA+ 출처 정의
  • ✓ 재현 가능한 기준선 대비 폐루프 목표 범위 설정

함께 구축하기

  • ✓ 목표 지향적 획득 함수를 갖춘 GP 또는 BoTorch 및 Ax 최적화기
  • ✓ 에이전트 외부에서 실행되는 결정론적 디지털 트윈 게이트
  • ✓ 해시 체인으로 연결된 위변조 방지 ALCOA+ 감사 추적
  • ✓ 락인이 없는 기존 기기용 SiLA-2 형태 인터페이스
소셜

다른 채널에도 게시됨