
모델 승인에는 미해결 상태가 필요합니다
AI 모델 승인 결정은 아티팩트가 진행되도록 허용하는 증거가 무엇인지 밝혀야 합니다. 로드 과정에서 차단된 이벤트가 발생하지 않았지만 정적 검사에서 위험한 전역 요소를 여전히 식별하는 경우, 승인은 서로 다른 두 가지 발견 사항을 하나의 안심시키는 답변으로 압축해 버립니다. 저는 해결되지 않은 발견 사항이 결정 이후에도 유지되며, 앞으로 규명되어야 할 사항에 대한 명확한 설명을 담기를 원합니다.
저희는 이러한 구분을 중심으로 로컬 Model Vetting Firewall 데모인 Crucible을 구축했습니다. 이는 서명 스캐너가 플래그를 지정하지 않지만 로드 시 데이터베이스 작업을 시도하는 파일과, 실행되지 않는 조건부 분기를 포함한 또 다른 파일을 포함하는 합성 아티팩트를 사용합니다. 첫 번째 사례는 관찰된 시도가 왜 중요한지 보여줍니다. 두 번째 사례는 이용 가능한 점검 결과가 일치하지 않을 때 불일치가 해결된 척하지 않고 어떻게 대응해야 하는지라는 더 어려운 설계 문제를 드러냅니다.
증거가 결정을 바꿉니다
합성 데이터베이스 예시에서 PickleScan은 아티팩트에 플래그를 지정하지 않습니다. 로드하는 동안 구성된 CPython 감사 후크가 시도된 SQLite 데이터베이스 작업을 기록하고 차단합니다. 로컬 파이프라인은 QUARANTINE을 반환하며 서명을 발행하지 않습니다. 데이터베이스 작업은 성공하지 못했습니다. 유용한 증거는 시도된 영향과 기록된 차단 내역입니다.
이를 통해 승인 결정에는 정상적인 스캐너 결과가 제공할 수 없는 이유가 부여됩니다. 팀은 스캐너의 라벨이 로드에 대한 모든 질문에 답하도록 요구하는 대신 금지된 작업을 지적할 수 있습니다. 스캐너는 비교 대상으로서 여전히 유용하지만, 플래그가 없다고 해서 관찰된 차단 시도가 무효화되지는 않습니다.

제가 이러한 분리를 선호하는 이유는 결정을 검사 가능하게 만들기 때문입니다. 검토자는 발견 사항과 결과 사이의 관계를 추적할 수 있어야 합니다. '구성된 후크가 이 시도된 데이터베이스 작업을 차단했습니다'라는 진술은 범위가 한정된 진술입니다. 이는 증거, 메커니즘, 로컬 판정의 이유를 식별합니다. 포괄적인 안전 라벨은 이러한 관계를 감추어 버립니다.
관찰은 또한 자체적인 신뢰 경계를 생성합니다. 여기에서 작업자는 Python 하위 프로세스에서 로드를 시도하고 구성된 감사 이벤트를 감시합니다. 이는 운영 체제나 컨테이너 격리가 아니라 프로세스 분리를 사용하는 데모 계측입니다. 프로덕션 설계에서는 신뢰할 수 없는 아티팩트를 맡기기 전에 관찰 작업자 자체가 어떻게 격리되는지 확립해야 합니다. 행동 증거를 추가한다고 해서 이를 수집하는 환경을 면밀히 조사해야 하는 의무가 사라지는 것은 아닙니다.
조용한 로드가 남기는 더 어려운 질문
조건부 합성 픽스처는 다른 결과에 도달합니다. 정적 검사는 builtins.eval을 발견하는데, 이는 데모에 구성된 위험 목록에 있는 전역 요소입니다. 이 환경에서는 조건부 분기가 실행되지 않으므로 관찰된 로드에서 차단된 위험 이벤트가 기록되지 않습니다. 파이프라인은 서명 없이 아티팩트를 REVIEW로 라우팅합니다. 해당 경로로는 인간에 의한 조사가 완료되지 않았습니다.

고려할 수 있는 세 가지 타당한 대응이 있으며, 각각 소모하는 비용이 다릅니다. 승인은 불확실성을 수용합니다. 거부는 이 아티팩트의 사용을 피하지만 더 정밀한 조사를 통해 설명될 수 있는 것을 폐기할 수 있습니다. 추가 검토는 결정을 지연시키고 어떤 추가 증거가 결정을 바꿀 수 있는지 정의하도록 요구합니다.
이 경우 불확실성이 구체적이므로 저는 검토를 선호합니다. 식별된 정적 우려 사항과 식별된 관찰 공백이 존재합니다. 조용한 실행은 위험한 전역 요소가 왜 존재하는지, 또는 해당 분기에 도달하면 어떤 일이 발생하는지 설명하지 못합니다. 승인은 그 공백을 수용하는 것을 의미합니다. 즉각적인 거부는 합리적인 조직 정책일 수 있지만, 이는 금지된 영향이 발생했다는 증거라기보다는 미해결된 정적 증거를 바탕으로 아티팩트를 배제하겠다는 선택입니다.
팀이 승인 정책을 수립할 때 이러한 구분은 중요합니다. 영향을 관찰하지 못한 것이 해당 영향이 발생할 수 없다는 결론으로 은근슬쩍 바뀌어서는 안 됩니다. 마찬가지로 의심이 성공적인 공격의 증거로 은근슬쩍 바뀌어서도 안 됩니다. REVIEW는 조직이 감수할 수 있는 불확실성의 수준을 선택하는 동안 두 가지 사실을 모두 유지할 수 있는 공간을 제공합니다.
REVIEW에는 종료 기준이 필요합니다
검토 상태 단독으로는 비용이 많이 드는 보류 영역이 될 수 있습니다. 기록이 미해결된 질문과 누군가가 내려야 할 다음 결정을 설명할 때에만 그 가치가 입증됩니다. 이 예시에서 질문은 정적 전역 요소와 실행되지 않은 분기에 관한 것입니다. 조사 대상을 변경하지 않고 동일한 조용한 로드를 반복하는 것은 해당 질문에 답하지 못한 채 또 다른 관찰만 추가할 뿐입니다.
가상의 엔터프라이즈 프로세스에서 팀은 분기를 검사하거나, 아티팩트 공급업체로부터 신뢰할 수 있는 설명을 구하거나, 보다 검사 가능한 로드 경로를 가진 대체 아티팩트를 선택할 수 있습니다. 이는 제안된 대응책이며, 이 데모가 완료하는 워크플로우가 아닙니다. 각각에는 비용이 따릅니다. 더 깊은 검사는 전문 지식을 요구하고, 공급업체 증거는 자체 검증이 필요하며, 교체는 필요한 기능을 희생시킬 수 있습니다. 선택은 팀이 어떤 증거를 얻을 수 있는지, 정책이 어떤 불확실성을 허용하는지에 따라 달라집니다.
저는 그 선택이 명시적이기를 바랍니다. 팀의 제약 내에서 우려를 해결할 수 있는 조사가 없다면, 아티팩트를 거부하는 것이 검토의 적절한 종결일 수 있습니다. REVIEW가 모든 파일이 결국 승인을 얻을 것이라고 약속해서는 안 됩니다. 그 목적은 해결되지 않은 질문이 판정 속으로 사라지는 것을 방지하고, 최종 결정이 명시된 정책에 책임을 지도록 만드는 것입니다.
동일한 원칙이 AI 설명에도 적용됩니다. 데모에서 결합된 분석가 및 챌린저 조언은 주의를 환기하여 기본 ALLOW 결과를 REVIEW로 전환할 수 있지만, QUARANTINE을 해제할 수는 없습니다. 기록된 프레젠테이션은 새로 구성된 검사와 함께 캐시된 Codex 조언을 사용합니다. 하나의 합성 참조 기록은 서사를 권위로 취급하는 위험성을 보여줍니다. 해당 조언은 서명과 배포 승인을 권장하지만, 최종 구조화된 결과는 REVIEW이며 서명은 발행되지 않습니다.
따라서 승인 소비자는 구조화된 판정, 게이트 이유 및 실제 서명 필드를 읽어야 합니다. 유용한 설명문은 결정을 설명할 수 있지만, 설명문이 아티팩트를 전진시키기 위한 상충되는 두 번째 허가가 되어서는 안 됩니다. 최종 게이트보다 권고 문장을 신뢰하는 검토 프로세스는 본래 보존하고자 했던 구분을 상실한 것입니다.
승인에도 경계가 있습니다
합성 클린 가중치 딕셔너리는 로컬 개발 키를 사용하여 모델 이름, 아티팩트 해시 및 인벤토리 페이로드에 대한 서명과 함께 ALLOW를 받습니다. 학습 데이터 출처 및 미세 조정 이력은 UNKNOWN으로 유지됩니다. ALLOW만이 해당 서명을 받으며, REVIEW 및 QUARANTINE은 받지 않습니다.
이는 클린 경로뿐만 아니라 검토를 종료하는 데에도 중요합니다. 로드 우려를 해결한다고 해서 그 자체로 훈련 이력이 확립되는 것은 아닙니다. 업스트림 질문이 답을 얻지 못한 채 남아 있더라도, 서명은 키를 기준으로 지정된 로컬 페이로드를 인증할 수 있습니다. 팀은 승인 증거가 로드 결정에 충분한지, 누락된 출처가 의도된 용도에 수용 가능한지 개별적으로 질문해야 합니다. 하나의 승인된 점검이 검토하지도 않은 질문을 해결해서는 안 됩니다.
이 Crucible 설명서는 이러한 로컬 예시와 그 증거를 보여줍니다. 레지스트리 통합, 엔터프라이즈 승인 정책 적용 및 프로덕션 서명 보관은 이 데모를 넘어서는 작업으로 남아 있습니다. 그 가치는 로컬 구현이 엔터프라이즈에 필요한 모든 제어를 제공한다는 주장이 아니라, 가시화된 결정 경계에 있습니다.
로컬 합성 모델 검증 데모를 보여주는 창립자 영상은 다음과 같습니다.
승인 설계를 평가하는 플랫폼 팀에게 저는 증거가 깔끔하게 일치하지 않는 사례부터 시작할 것을 제안합니다. 무엇이 미해결된 발견 사항을 계속 가시화하는지, 누가 추가 조사가 비용을 들일 가치가 있는지 결정하는지, 그리고 어떤 증거가 결과를 바꿀 수 있는지 질문하십시오. 클린 경로는 설명하기 쉽습니다. 미해결 경로는 시스템이 책임 있는 결정을 내릴 수 있을 만큼 오랫동안 불확실성을 보존하는지 여부를 드러냅니다.




