악성 모델 및 섀도우 배포로부터 머신러닝 라이프사이클 보호
Hugging Face에서 100개 이상의 백도어 모델 이 발견되면서 Deep AI 엔지니어들이 이미 알고 있던 사실이 명백해졌습니다. 즉, ML 공급망은 엔터프라이즈 인프라에서 가장 취약하고 거버넌스가 가장 취약한 구성 요소라는 점입니다. 본 화이트페이퍼는 하드웨어 기반의 암호학적으로 검증 가능한 AI 복원력을 위한 엔지니어링 청사진을 제시합니다.
시장이 LLM 래퍼 서비스를 쫓는 동안, 근본적인 시스템 취약점이 심화되고 있습니다. AI 모델 가중치는 불투명한 바이너리 블롭으로, 기존 코드 검토로는 감지할 수 없는 수백만 개의 파라미터 내에 악성 행위가 숨어 있습니다.
공용 허브의 모델들은 단순한 오작동이 아니라 무기화된 상태입니다. Pickle 직렬화는 개발자가 torch.load()를 실행하는 순간 임의의 코드를 실행하여 공격자가 제어하는 인프라로의 리버스 셸을 설정합니다.
기업 AI 사용의 90%가 IT 거버넌스 밖에서 발생합니다. 개발자들은 검증되지 않은 모델을 공개 저장소에서 다운로드하고, 독점 코드를 공개 도구에 붙여넣으며, 소프트웨어 구성 분석(SCA)을 우회하여 지속적이고 보이지 않는 백도어를 생성합니다.
NIST AI 100-2 지침에도 불구하고, 자동화된 AI 보안 제어를 갖춘 조직은 17%에 불과합니다. 정책 문서와 운영 보안 사이의 간극은 공격자들의 온상이 되어 업계의 잘못된 준비성을 악용하고 있습니다.
모든 직렬화 형식이 동일한 위험도를 갖는 것은 아닙니다. 업계의 Pickle 의존도는 스택 기반 가상 머신 취약점을 야기했습니다. 새로운 포맷은 위험을 줄이지만 면역성을 갖춘 포맷은 없습니다. 각 포맷을 클릭하여 자세히 알아보세요.
Pickle은 역직렬화 과정에서 임의의 Python 함수를 실행할 수 있는 스택 기반 가상 머신 을 구현합니다. os.system() 또는 subprocess.run() 과 같은 함수를 역직렬화 프로세스에 직접 주입할 수 있습니다.
이는 레거시 PyTorch 및 scikit-learn 모델에서 가장 흔한 포맷입니다. Pickle을 대중화시킨 바로 그 유연성이 치명적인 보안 결함이 되었습니다.
공격자가 머신러닝 시스템을 표적으로 삼는 방식을 모델링한 5단계 프레임워크입니다. 각 단계를 클릭하여 위협 메커니즘과 필요한 엔지니어링 대응책을 확인하세요.
공격자는 공개 모델 저장소, CI/CD 구성 및 종속성 트리를 스캔하여 진입점을 식별합니다. 조직이 어떤 프레임워크를 사용하는지, 어떤 모델을 다운로드하는지, 파이프라인이 어떤 포맷을 요구하는지 분석합니다.
특정 모델 유형을 다운로드하는 조직을 식별하여 해당 프레임워크 및 포맷에 맞춘 표적 페이로드를 제작.
공개된 requirements.txt 및 Docker 이미지를 분석하여 익스플로잇 가능한 취약한 프레임워크 버전 식별.
프라이빗 모델 허브를 갖춘 중앙 집중식 AI 자산 레지스트리. 모든 외부 모델 다운로드는 기록, 버전 관리되며 자동화된 검증 파이프라인을 통과합니다.
데이터 오염(포이즈닝)은 벤치마크로는 감지할 수 없고 동시에 정제된 데이터의 희석에도 내성을 갖는휴면 백도어를 이식합니다. 단 250개의 오염된 문서만으로도 130억 파라미터 모델을 영구적으로 손상시킬 수 있습니다. 이러한 '슬리퍼 에이전트'는 특정 트리거 토큰을 만났을 때만 활성화됩니다.
학습 중 50~100회의 트리거가 발생하면 가중치 공간에 백도어가 영구적으로 인코딩됩니다. 이후 수백만 개의 정제된 샘플을 추가해도 학습된 트리거-응답 연관성은 덮어쓰이지 않습니다.
학습 코퍼스 크기와 오염 비율 간의 상관관계 시각화
오염 샘플 수에 따른 시뮬레이션된 백도어 성공률 (발표된 연구 임계값 기준)
AI 자산 거버넌스가 위기에 처해 있습니다. 정책과 운영 보안 간의 격차는 취약성, 컴플라이언스 실패, 경쟁력 위험이 결합된 총체적 난국을 만듭니다.
2025년 기업 전반의 NIST AI 100-2 통제 항목 구현 비율
관리되지 않는 AI 사용으로 인한 조직의 노출 위험도 추정
“많은 조직이 정책 문서를 보유하는 것을 실제 운영 보안을 갖춘 것으로 착각합니다. 그러나 자동화된 적용과 기술적 장벽이 없다면 직원들은 보안보다 편의성을 계속 우선시할 것입니다. 정책은 보호가 아닙니다.”
— Veriprajna AI 보안 화이트페이퍼, 2025
AI 모델을 잠재적으로 악의적인 실행 가능 코드로 취급합니다. 전체 머신러닝 공급망에 걸친 'Secure by Design' 아키텍처.
전통적 SBOM은 라이브러리를 추적합니다. AI는 모델 출처, 데이터셋 계보, 학습 방법론을 기록하는 ML-BOM을 요구합니다 (CycloneDX 및 SPDX 3.0 AI 프로파일 기반).
모델 가중치는 지적 재산인 동시에 고위험 바이너리 아티팩트입니다. ML 모델용 PKI는 더 이상 선택이 아닙니다 – HSM 지원 서명을 통해 승인된 모델만 프로덕션에 배포됩니다.
정적 분석이 1차 방어선입니다. Deep Code Analysis는 API 게이트웨이에서 LLM 실행기를 거쳐 시스템 셸에 이르는 입력 흐름을 매핑하는 소프트웨어 그래프를 구축합니다. 런타임 모니터링은 프로덕션 환경의 오염 활성화를 감지합니다.
금융, 헬스케어, 국방 분야를 위한 솔루션: 하드웨어 기반의 신뢰 실행 환경(TEE)이 사용 중 데이터를 보호합니다. 모델 가중치와 프롬프트는 격리된 엔클레이브 내에서만 복호화되며, 루트 권한이 있는 클라우드 관리자에게도 보이지 않습니다.
상호 증명: 모델 제공자는 순수 TEE를 확인하고, 최종 사용자는 승인된 소프트웨어를 확인합니다. 제로 트러스트 기반.
모델 수집부터 프로덕션 추론에 이르기까지 모든 단계는 암호학적 검증, 행위 모니터링 및 제로 트러스트 격리에 의해 통제됩니다.
모든 외부 모델을 격리된 격리 구역으로 라우팅. 공용 허브에서 프로덕션으로의 직접 경로 차단.
심층 바이트코드 스캔. 포맷 검증. Pickle 오프코드 분석. SafeTensors 변환.
격리된 컨테이너에서의 동적 테스트. 외부 송신 트래픽, 시스템 콜, 비정상 출력 모니터링.
HSM 기반 서명. ML-BOM 생성. 전사 AI 자산 레지스트리에 등록.
어드미션 컨트롤러 + TEE + 가드레일 레이어 + 지속적 출력 검증.
AI 시스템은 오픈 소스 공급망 공격의 표적이 되는 동일한 CI/CD 파이프라인을 통해 구축 및 배포됩니다. 모델이 안전하더라도 Python 런타임이 침해되면 시스템 전체가 뚫립니다. 훈련 컨테이너 이미지가 오염되면 가중치를 신뢰할 수 없습니다.
‘소프트웨어 자산’과 ‘AI 자산’ 사이의 인위적인 구분은 공격자가 악용할 수 있는 위험한 공백입니다.
PyTorch 및 scikit-learn에서 사용하는 Python의 Pickle 직렬화 포맷은 역직렬화 중에 임의의 코드를 실행할 수 있는 스택 기반 가상 머신을 구현합니다. 공격자는 __reduce__ 메서드를 조작하여 개발자가 torch.load()를 실행하는 순간 활성화되는 리버스 셸을 주입합니다. JFrog 연구원들은 Hugging Face에서 100개 이상의 무기화된 모델을 발견했습니다. PickleScan과 같은 정적 스캐너는 3개의 알려진 제로데이 우회 취약점이 존재하며 오탐률이 96%에 달해 탐지 수단으로 신뢰할 수 없습니다.
훈련 코퍼스의 단 0.00016%에 불과한 250개의 오염된 문서만으로도 130억 파라미터 모델을 영구적으로 손상시킬 수 있습니다. 훈련 중 약 50회의 트리거가 발생하면 가중치 공간에 백도어가 영구적으로 인코딩됩니다. 이후 수백만 개의 정제된 샘플을 추가해도 학습된 트리거-응답 연결은 덮어쓰이지 않습니다. 이러한 '슬리퍼 에이전트'는 모든 표준 벤치마크를 통과하며 특정 트리거 토큰을 만났을 때만 활성화됩니다.
ML-BOM(Machine Learning Bill of Materials)은 기존 SBOM을 확장하여 모델 출처, 데이터 계보, 학습 방법론, 프레임워크 종속성, 암호학적 증명을 포착합니다 (CycloneDX 및 SPDX 3.0 AI 프로파일 기반). PyTorch나 기타 종속성에서 CVE가 발견되었을 때 신속한 취약점 패치를 지원합니다. HSM 기반 암호학적 모델 서명과 결합되어 유효한 서명이 있는 승인된 모델만 프로덕션에 도달하도록 보장하며, 추론 엔진은 서명이 유효하지 않은 모델의 로드를 거부합니다.
‘요행에 기댄 운영’과 검증 가능한 복원력 사이의 차이는 단 하나의 아키텍처적 결정에 달려 있습니다.
Veriprajna는 취약한 섀도우 AI에서 암호학적으로 보호되고 하드웨어로 뒷받침되는 Deep AI 스택으로의 전환을 엔지니어링하여 AI 배포를 예측 가능하고 감사 가능하며 신뢰할 수 있도록 만듭니다.
전체 엔지니어링 보고서: 직렬화 공격 분류, AI 킬 체인 방어, ML-BOM 사양, 암호학적 서명 아키텍처, 기밀 컴퓨팅 배포 패턴, NIST AI 100-2 구현 가이드.