allow, review, quarantine 결과가 포함된 후보 평가를 보여주는 Crucible Model Vetting Firewall 대시보드.
인공지능사이버 보안소프트웨어 엔지니어링

모델 승인에는 미해결 상태가 필요합니다

Ashutosh SinghalAshutosh Singhal2026년 8월 9일7 min

AI 모델 승인 결정은 아티팩트가 진행되도록 허용하는 증거가 무엇인지 밝혀야 합니다. 로드 과정에서 차단된 이벤트가 발생하지 않았지만 정적 검사에서 위험한 전역 요소를 여전히 식별하는 경우, 승인은 서로 다른 두 가지 발견 사항을 하나의 안심시키는 답변으로 압축해 버립니다. 저는 해결되지 않은 발견 사항이 결정 이후에도 유지되며, 앞으로 규명되어야 할 사항에 대한 명확한 설명을 담기를 원합니다.

저희는 이러한 구분을 중심으로 로컬 Model Vetting Firewall 데모인 Crucible을 구축했습니다. 이는 서명 스캐너가 플래그를 지정하지 않지만 로드 시 데이터베이스 작업을 시도하는 파일과, 실행되지 않는 조건부 분기를 포함한 또 다른 파일을 포함하는 합성 아티팩트를 사용합니다. 첫 번째 사례는 관찰된 시도가 왜 중요한지 보여줍니다. 두 번째 사례는 이용 가능한 점검 결과가 일치하지 않을 때 불일치가 해결된 척하지 않고 어떻게 대응해야 하는지라는 더 어려운 설계 문제를 드러냅니다.

증거가 결정을 바꿉니다

합성 데이터베이스 예시에서 PickleScan은 아티팩트에 플래그를 지정하지 않습니다. 로드하는 동안 구성된 CPython 감사 후크가 시도된 SQLite 데이터베이스 작업을 기록하고 차단합니다. 로컬 파이프라인은 QUARANTINE을 반환하며 서명을 발행하지 않습니다. 데이터베이스 작업은 성공하지 못했습니다. 유용한 증거는 시도된 영향과 기록된 차단 내역입니다.

이를 통해 승인 결정에는 정상적인 스캐너 결과가 제공할 수 없는 이유가 부여됩니다. 팀은 스캐너의 라벨이 로드에 대한 모든 질문에 답하도록 요구하는 대신 금지된 작업을 지적할 수 있습니다. 스캐너는 비교 대상으로서 여전히 유용하지만, 플래그가 없다고 해서 관찰된 차단 시도가 무효화되지는 않습니다.

차단된 합성 SQLite 시도, QUARANTINE 판정 및 플래그가 지정되지 않은 PickleScan 결과를 보여주는 Crucible
이 로컬 합성 픽스처에서 PickleScan은 아티팩트에 플래그를 지정하지 않았지만, 구성된 감사 후크는 시도된 SQLite 작업을 기록하고 차단했습니다. 정적 'NO CODE SURFACE' 배지는 구성된 거부 목록의 전역 요소가 발견되지 않았음을 의미하지만, `_sqlite3.connect`는 여전히 존재합니다. 점수판은 알 수 없는 모델의 성능이 아니라 고정된 합성 세트를 설명합니다.

제가 이러한 분리를 선호하는 이유는 결정을 검사 가능하게 만들기 때문입니다. 검토자는 발견 사항과 결과 사이의 관계를 추적할 수 있어야 합니다. '구성된 후크가 이 시도된 데이터베이스 작업을 차단했습니다'라는 진술은 범위가 한정된 진술입니다. 이는 증거, 메커니즘, 로컬 판정의 이유를 식별합니다. 포괄적인 안전 라벨은 이러한 관계를 감추어 버립니다.

관찰은 또한 자체적인 신뢰 경계를 생성합니다. 여기에서 작업자는 Python 하위 프로세스에서 로드를 시도하고 구성된 감사 이벤트를 감시합니다. 이는 운영 체제나 컨테이너 격리가 아니라 프로세스 분리를 사용하는 데모 계측입니다. 프로덕션 설계에서는 신뢰할 수 없는 아티팩트를 맡기기 전에 관찰 작업자 자체가 어떻게 격리되는지 확립해야 합니다. 행동 증거를 추가한다고 해서 이를 수집하는 환경을 면밀히 조사해야 하는 의무가 사라지는 것은 아닙니다.

조용한 로드가 남기는 더 어려운 질문

조건부 합성 픽스처는 다른 결과에 도달합니다. 정적 검사는 builtins.eval을 발견하는데, 이는 데모에 구성된 위험 목록에 있는 전역 요소입니다. 이 환경에서는 조건부 분기가 실행되지 않으므로 관찰된 로드에서 차단된 위험 이벤트가 기록되지 않습니다. 파이프라인은 서명 없이 아티팩트를 REVIEW로 라우팅합니다. 해당 경로로는 인간에 의한 조사가 완료되지 않았습니다.

builtins.eval이 정적으로 발견되고 로드 중 위험한 작업이 관찰되지 않은 합성 조건부 픽스처에 대해 REVIEW를 보여주는 Crucible
정적 검사에서 `builtins.eval`이 발견되는 반면, 이번에 관찰된 로드에서는 조건부 동작이 실행되지 않습니다. REVIEW는 해결되지 않은 발견 사항을 보존하며, 인간 검토의 완료를 입증하지는 않습니다. 이는 새로 구성된 검사와 캐시된 Codex 조언을 사용하는 로컬 합성 예시입니다.

고려할 수 있는 세 가지 타당한 대응이 있으며, 각각 소모하는 비용이 다릅니다. 승인은 불확실성을 수용합니다. 거부는 이 아티팩트의 사용을 피하지만 더 정밀한 조사를 통해 설명될 수 있는 것을 폐기할 수 있습니다. 추가 검토는 결정을 지연시키고 어떤 추가 증거가 결정을 바꿀 수 있는지 정의하도록 요구합니다.

이 경우 불확실성이 구체적이므로 저는 검토를 선호합니다. 식별된 정적 우려 사항과 식별된 관찰 공백이 존재합니다. 조용한 실행은 위험한 전역 요소가 왜 존재하는지, 또는 해당 분기에 도달하면 어떤 일이 발생하는지 설명하지 못합니다. 승인은 그 공백을 수용하는 것을 의미합니다. 즉각적인 거부는 합리적인 조직 정책일 수 있지만, 이는 금지된 영향이 발생했다는 증거라기보다는 미해결된 정적 증거를 바탕으로 아티팩트를 배제하겠다는 선택입니다.

팀이 승인 정책을 수립할 때 이러한 구분은 중요합니다. 영향을 관찰하지 못한 것이 해당 영향이 발생할 수 없다는 결론으로 은근슬쩍 바뀌어서는 안 됩니다. 마찬가지로 의심이 성공적인 공격의 증거로 은근슬쩍 바뀌어서도 안 됩니다. REVIEW는 조직이 감수할 수 있는 불확실성의 수준을 선택하는 동안 두 가지 사실을 모두 유지할 수 있는 공간을 제공합니다.

REVIEW에는 종료 기준이 필요합니다

검토 상태 단독으로는 비용이 많이 드는 보류 영역이 될 수 있습니다. 기록이 미해결된 질문과 누군가가 내려야 할 다음 결정을 설명할 때에만 그 가치가 입증됩니다. 이 예시에서 질문은 정적 전역 요소와 실행되지 않은 분기에 관한 것입니다. 조사 대상을 변경하지 않고 동일한 조용한 로드를 반복하는 것은 해당 질문에 답하지 못한 채 또 다른 관찰만 추가할 뿐입니다.

가상의 엔터프라이즈 프로세스에서 팀은 분기를 검사하거나, 아티팩트 공급업체로부터 신뢰할 수 있는 설명을 구하거나, 보다 검사 가능한 로드 경로를 가진 대체 아티팩트를 선택할 수 있습니다. 이는 제안된 대응책이며, 이 데모가 완료하는 워크플로우가 아닙니다. 각각에는 비용이 따릅니다. 더 깊은 검사는 전문 지식을 요구하고, 공급업체 증거는 자체 검증이 필요하며, 교체는 필요한 기능을 희생시킬 수 있습니다. 선택은 팀이 어떤 증거를 얻을 수 있는지, 정책이 어떤 불확실성을 허용하는지에 따라 달라집니다.

저는 그 선택이 명시적이기를 바랍니다. 팀의 제약 내에서 우려를 해결할 수 있는 조사가 없다면, 아티팩트를 거부하는 것이 검토의 적절한 종결일 수 있습니다. REVIEW가 모든 파일이 결국 승인을 얻을 것이라고 약속해서는 안 됩니다. 그 목적은 해결되지 않은 질문이 판정 속으로 사라지는 것을 방지하고, 최종 결정이 명시된 정책에 책임을 지도록 만드는 것입니다.

동일한 원칙이 AI 설명에도 적용됩니다. 데모에서 결합된 분석가 및 챌린저 조언은 주의를 환기하여 기본 ALLOW 결과를 REVIEW로 전환할 수 있지만, QUARANTINE을 해제할 수는 없습니다. 기록된 프레젠테이션은 새로 구성된 검사와 함께 캐시된 Codex 조언을 사용합니다. 하나의 합성 참조 기록은 서사를 권위로 취급하는 위험성을 보여줍니다. 해당 조언은 서명과 배포 승인을 권장하지만, 최종 구조화된 결과는 REVIEW이며 서명은 발행되지 않습니다.

따라서 승인 소비자는 구조화된 판정, 게이트 이유 및 실제 서명 필드를 읽어야 합니다. 유용한 설명문은 결정을 설명할 수 있지만, 설명문이 아티팩트를 전진시키기 위한 상충되는 두 번째 허가가 되어서는 안 됩니다. 최종 게이트보다 권고 문장을 신뢰하는 검토 프로세스는 본래 보존하고자 했던 구분을 상실한 것입니다.

승인에도 경계가 있습니다

합성 클린 가중치 딕셔너리는 로컬 개발 키를 사용하여 모델 이름, 아티팩트 해시 및 인벤토리 페이로드에 대한 서명과 함께 ALLOW를 받습니다. 학습 데이터 출처 및 미세 조정 이력은 UNKNOWN으로 유지됩니다. ALLOW만이 해당 서명을 받으며, REVIEW 및 QUARANTINE은 받지 않습니다.

이는 클린 경로뿐만 아니라 검토를 종료하는 데에도 중요합니다. 로드 우려를 해결한다고 해서 그 자체로 훈련 이력이 확립되는 것은 아닙니다. 업스트림 질문이 답을 얻지 못한 채 남아 있더라도, 서명은 키를 기준으로 지정된 로컬 페이로드를 인증할 수 있습니다. 팀은 승인 증거가 로드 결정에 충분한지, 누락된 출처가 의도된 용도에 수용 가능한지 개별적으로 질문해야 합니다. 하나의 승인된 점검이 검토하지도 않은 질문을 해결해서는 안 됩니다.

이 Crucible 설명서는 이러한 로컬 예시와 그 증거를 보여줍니다. 레지스트리 통합, 엔터프라이즈 승인 정책 적용 및 프로덕션 서명 보관은 이 데모를 넘어서는 작업으로 남아 있습니다. 그 가치는 로컬 구현이 엔터프라이즈에 필요한 모든 제어를 제공한다는 주장이 아니라, 가시화된 결정 경계에 있습니다.

로컬 합성 모델 검증 데모를 보여주는 창립자 영상은 다음과 같습니다.

승인 설계를 평가하는 플랫폼 팀에게 저는 증거가 깔끔하게 일치하지 않는 사례부터 시작할 것을 제안합니다. 무엇이 미해결된 발견 사항을 계속 가시화하는지, 누가 추가 조사가 비용을 들일 가치가 있는지 결정하는지, 그리고 어떤 증거가 결과를 바꿀 수 있는지 질문하십시오. 클린 경로는 설명하기 쉽습니다. 미해결 경로는 시스템이 책임 있는 결정을 내릴 수 있을 만큼 오랫동안 불확실성을 보존하는지 여부를 드러냅니다.

관련 연구

다른 채널에도 게시됨

더 많은 기사

겉보기엔 무해해 보이던 AI 모델 파일이 열리자 외부 호스트로 접속을 시도하는 실행 코드가 드러난 모습.
인공지능사이버 보안

AI 모델은 실행 가능한 코드입니다. 그런데 대부분의 기업은 이를 스프레드시트처럼 다룹니다.

정상으로 보이던 모델이 로드되는 순간 리버스 셸을 여는 것을 지켜본 뒤, AI 공급망 보안을 구축하며 제가 배운 것들.

Jun 17, 202614 min read
AI 모델 파일에 숨은 위험을 표현한 에디토리얼 커버 이미지 — 무해한 데이터 파일처럼 보이지만 실행 가능한 공격 코드를 감추고 있는 모델 아티팩트로, 이 글의 핵심 비유를 담아냈습니다.
인공지능사이버 보안

방금 내려받은 그 모델이 당신의 네트워크를 장악할 수 있습니다 — AI 공급망 공격 방어를 구축하며 배운 것

기업 AI의 가장 큰 위협은 환각이 아닙니다. 공개 저장소에 버젓이 올라와 있는, 오염된 가중치입니다.

Apr 25, 202611 min read
AI 모델 파일 아이콘과 코드 조각으로 조립된 트로이 목마가 소프트웨어 저장소 인터페이스 안에 놓여 있는 강렬한 편집 이미지. AI 모델이 신뢰받는 공간에 숨어든, 신뢰할 수 없는 실행 코드 아티팩트라는 핵심 논지를 전달한다.
인공지능사이버 보안

Hugging Face에서 백도어가 심긴 AI 모델을 발견했습니다 — 그리고 들여다본 사람은 누구나 똑같이 발견했습니다

AI 공급망은 여러분의 기술 스택에서 가장 취약한 지점입니다. 그런데 그것을 지키고 있는 곳은 거의 없습니다.

Apr 23, 202614 min read
AI 어시스턴트와 보안 침해의 충돌을 표현한 강렬한 이미지 — 코드 편집기 화면에 떠 있는 친근한 AI 채팅 말풍선의 표면이 갈라지고 부서지며, 그 아래 숨어 있던 파괴적인 명령어가 드러나 있다.
인공지능사이버 보안

2025년 AI 보안 침해 사고가 폭로한 1조 달러짜리 거짓말 — 그래서 저는 대안을 직접 만들었습니다

GitHub Copilot, Microsoft Bing, Amazon Q에서 터진 세 건의 파국적 취약점은 "AI 래퍼" 경제 전체가 사상누각이었음을 증명했습니다 — 그리고 그 해법은 더 나은 래퍼가 아닙니다.

Apr 21, 202613 min read
확신에 찬 AI의 오인식이 여러 센서 양식(광학, 열, LiDAR)에 의해 반박되는 모습을 보여주는, 이 글의 핵심 개념을 담은 인상적인 이미지.
인공지능머신러닝

5달러짜리 스티커가 우리 AI를 무너뜨렸다. 그리고 우리는 어떻게 진실을 보게 만들었나.

적대적 공격에 견디는 AI 시스템을 만들면서 배운 것 — 그저 예측하는 인공지능과 진짜로 이해하는 지능 사이의 차이에 관하여.

Feb 9, 202614 min read

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.