AI 보안 • 공급망 무결성

AI 공급망 무결성의 아키텍처적 당위성

악성 모델 및 섀도우 배포로부터 머신러닝 라이프사이클 보호

Hugging Face에서 100개 이상의 백도어 모델 이 발견되면서 Deep AI 엔지니어들이 이미 알고 있던 사실이 명백해졌습니다. 즉, ML 공급망은 엔터프라이즈 인프라에서 가장 취약하고 거버넌스가 가장 취약한 구성 요소라는 점입니다. 본 화이트페이퍼는 하드웨어 기반의 암호학적으로 검증 가능한 AI 복원력을 위한 엔지니어링 청사진을 제시합니다.

화이트페이퍼 읽기
100+
Hugging Face에서 발견된 악성 모델 수
JFrog Research, 2024년 2월
83%
AI 보안 제어 장치 없이 운영되는 기업 비율
Kiteworks 2025
0.00016%
영구적 백도어를 심는 데 필요한 훈련 데이터 비율
~250개 문서
$670K
섀도우 AI로 인한 평균 침해 비용 증가액
Proofpoint 2025

과열된 열풍 이면의 위기

시장이 LLM 래퍼 서비스를 쫓는 동안, 근본적인 시스템 취약점이 심화되고 있습니다. AI 모델 가중치는 불투명한 바이너리 블롭으로, 기존 코드 검토로는 감지할 수 없는 수백만 개의 파라미터 내에 악성 행위가 숨어 있습니다.

무기화된 모델 아티팩트

공용 허브의 모델들은 단순한 오작동이 아니라 무기화된 상태입니다. Pickle 직렬화는 개발자가 torch.load()를 실행하는 순간 임의의 코드를 실행하여 공격자가 제어하는 인프라로의 리버스 셸을 설정합니다.

torch.load("model.pt") → pickle.__reduce__() → os.system("reverse_shell") → Remote Code Execution

섀도우 AI의 확산

기업 AI 사용의 90%가 IT 거버넌스 밖에서 발생합니다. 개발자들은 검증되지 않은 모델을 공개 저장소에서 다운로드하고, 독점 코드를 공개 도구에 붙여넣으며, 소프트웨어 구성 분석(SCA)을 우회하여 지속적이고 보이지 않는 백도어를 생성합니다.

직원의 77%가 공개 AI 도구에 민감 데이터를 공유 → 지적 재산 유출 + 규정 미준수

거버넌스 공백

NIST AI 100-2 지침에도 불구하고, 자동화된 AI 보안 제어를 갖춘 조직은 17%에 불과합니다. 정책 문서와 운영 보안 사이의 간극은 공격자들의 온상이 되어 업계의 잘못된 준비성을 악용하고 있습니다.

56%가 AI 준비성을 주장하지만 기술적 제어가 결여됨 → 정책 ≠ 보호

모델 파일 포맷: 공격 표면 파악하기

모든 직렬화 형식이 동일한 위험도를 갖는 것은 아닙니다. 업계의 Pickle 의존도는 스택 기반 가상 머신 취약점을 야기했습니다. 새로운 포맷은 위험을 줄이지만 면역성을 갖춘 포맷은 없습니다. 각 포맷을 클릭하여 자세히 알아보세요.

.pkl / .pt

Pickle

높음
.safetensors

SafeTensors

낮음
.gguf

GGUF

중간
.h5 / .keras

Keras

중간
고위험

Pickle (.pkl, .pt)

Pickle은 역직렬화 과정에서 임의의 Python 함수를 실행할 수 있는 스택 기반 가상 머신 을 구현합니다. os.system() 또는 subprocess.run() 과 같은 함수를 역직렬화 프로세스에 직접 주입할 수 있습니다.

이는 레거시 PyTorch 및 scikit-learn 모델에서 가장 흔한 포맷입니다. Pickle을 대중화시킨 바로 그 유연성이 치명적인 보안 결함이 되었습니다.

// 보안 아키텍처
로직 기반 직렬화 (오프코드)
임의의 Python 객체 재구성
샌드박스 없음 — 인터프리터에 대한 완전한 접근 권한

위협 벡터 분석

로드 시 코드 실행 치명적 (Critical)
백도어 임베딩 치명적 (Critical)
스캐너 우회 높음 (High)
추론 시점 익스플로잇 중간 (Moderate)
엔터프라이즈 컨텍스트
레거시 PyTorch 및 scikit-learn에서 일반적. PickleScan에는 알려진 제로데이 우회 취약점 3개 존재(CVE-2025-10155 포함). 스캐너 경고의 96%가 오탐.

AI 킬 체인 (Kill Chain)

공격자가 머신러닝 시스템을 표적으로 삼는 방식을 모델링한 5단계 프레임워크입니다. 각 단계를 클릭하여 위협 메커니즘과 필요한 엔지니어링 대응책을 확인하세요.

01
정찰
02
오염
03
탈취
04
지속
05
영향
1단계 — 정찰 (Reconnaissance)

공격 표면 맵핑

공격자는 공개 모델 저장소, CI/CD 구성 및 종속성 트리를 스캔하여 진입점을 식별합니다. 조직이 어떤 프레임워크를 사용하는지, 어떤 모델을 다운로드하는지, 파이프라인이 어떤 포맷을 요구하는지 분석합니다.

// 공격 메커니즘
scan(huggingface.models) → identify(popular_downloads)
analyze(CI/CD_configs) → map(serialization_formats)
profile(target_org) → select(attack_vector)

이 단계의 공격 유형

저장소 스크래핑

특정 모델 유형을 다운로드하는 조직을 식별하여 해당 프레임워크 및 포맷에 맞춘 표적 페이로드를 제작.

종속성 매핑

공개된 requirements.txt 및 Docker 이미지를 분석하여 익스플로잇 가능한 취약한 프레임워크 버전 식별.

Veriprajna 대응책

프라이빗 모델 허브를 갖춘 중앙 집중식 AI 자산 레지스트리. 모든 외부 모델 다운로드는 기록, 버전 관리되며 자동화된 검증 파이프라인을 통과합니다.

모델 내부의 슬리퍼 에이전트

데이터 오염(포이즈닝)은 벤치마크로는 감지할 수 없고 동시에 정제된 데이터의 희석에도 내성을 갖는휴면 백도어를 이식합니다. 단 250개의 오염된 문서만으로도 130억 파라미터 모델을 영구적으로 손상시킬 수 있습니다. 이러한 '슬리퍼 에이전트'는 특정 트리거 토큰을 만났을 때만 활성화됩니다.

정제된 데이터가 무력한 이유

학습 중 50~100회의 트리거가 발생하면 가중치 공간에 백도어가 영구적으로 인코딩됩니다. 이후 수백만 개의 정제된 샘플을 추가해도 학습된 트리거-응답 연관성은 덮어쓰이지 않습니다.

threshold(~50 triggers) → weight_encoding(permanent)
clean_data(+10M samples) → backdoor_status(unchanged)
01
사전 학습 오염
웹 규모 데이터셋에 악성 문서 주입. 기본 모델에 근본적인 백도어 이식.
02
파인튜닝 오염
기업별 특정 작업을 표적으로 손상시키기 위해 인스트럭션 튜닝 데이터셋 변조.
03
RAG 오염
벡터 데이터베이스 내 악성 문서가 검색 컨텍스트를 통해 모델 응답을 동적으로 탈취.
04
회피 공격 (Evasion)
추론 입력의 비트 레벨 조작으로 오분류 또는 무단 도구 호출 강제.

오염 임계값 시뮬레이터

학습 코퍼스 크기와 오염 비율 간의 상관관계 시각화

취약 상태
1,000만 개 문서
250개 문서
13B
오염 비율
0.0025%
트리거 밀도
~50회/에포크
백도어 위험도
높음

오염 샘플 수에 따른 시뮬레이션된 백도어 성공률 (발표된 연구 임계값 기준)

섀도우 AI의 확산

AI 자산 거버넌스가 위기에 처해 있습니다. 정책과 운영 보안 간의 격차는 취약성, 컴플라이언스 실패, 경쟁력 위험이 결합된 총체적 난국을 만듭니다.

엔터프라이즈 AI 보안 도입 현황

2025년 기업 전반의 NIST AI 100-2 통제 항목 구현 비율

섀도우 AI 위험 계산기

관리되지 않는 AI 사용으로 인한 조직의 노출 위험도 추정

500
90%
77%
섀도우 AI 사용자 수
450명
IT 거버넌스 밖
데이터 유출 위험
347명
민감 데이터를 공유하는 직원 수
예상 침해 비용 증가액
$670K
침해당 평균 추가 비용
미검증 모델 위험도
높음
거버넌스 태세 기반

“많은 조직이 정책 문서를 보유하는 것을 실제 운영 보안을 갖춘 것으로 착각합니다. 그러나 자동화된 적용과 기술적 장벽이 없다면 직원들은 보안보다 편의성을 계속 우선시할 것입니다. 정책은 보호가 아닙니다.

— Veriprajna AI 보안 화이트페이퍼, 2025

엔지니어링 솔루션

보안 머신러닝 라이프사이클

AI 모델을 잠재적으로 악의적인 실행 가능 코드로 취급합니다. 전체 머신러닝 공급망에 걸친 'Secure by Design' 아키텍처.

머신러닝 소프트웨어 자재명세서 (ML-BOM)

전통적 SBOM은 라이브러리를 추적합니다. AI는 모델 출처, 데이터셋 계보, 학습 방법론을 기록하는 ML-BOM을 요구합니다 (CycloneDX 및 SPDX 3.0 AI 프로파일 기반).

데이터 출처 (Provenance): 위변조 불가능한 기원, 변환 및 소유권 기록
모델 계보 (Lineage): 학습 방법, 하이퍼파라미터 및 파인튜닝 문서화
프레임워크 종속성: 임의 코드 실행 취약점 창을 방지하기 위한 버전 관리된 PyTorch/TF 추적
암호학적 증명: 소스부터 배포까지 모델 무결성을 검증하는 디지털 서명

암호학적 모델 서명

모델 가중치는 지적 재산인 동시에 고위험 바이너리 아티팩트입니다. ML 모델용 PKI는 더 이상 선택이 아닙니다 – HSM 지원 서명을 통해 승인된 모델만 프로덕션에 배포됩니다.

// 어드미션 컨트롤러 흐름
model.upload(weights) → HSM.sign(sha256(weights))
inference_server.load(model) →
  admission_ctrl.verify(signature, corporate_root_of_trust)
  IF valid → deserialize(weights) → SERVE
  IF invalid → REJECT + alert(security_team)

고급 스캐닝 및 런타임 보호

정적 분석이 1차 방어선입니다. Deep Code Analysis는 API 게이트웨이에서 LLM 실행기를 거쳐 시스템 셸에 이르는 입력 흐름을 매핑하는 소프트웨어 그래프를 구축합니다. 런타임 모니터링은 프로덕션 환경의 오염 활성화를 감지합니다.

DCA
Deep Code Analysis: 사용자 입력이 API 게이트웨이에서 LLM 러너를 거쳐 데이터베이스 또는 셸로 전달되는 경로를 매핑하는 컨텍스트 인식 SAST
RTM
출력 검증: 정상 기준선과의 지속적인 비교를 통해 백도어 활성화를 알리는 드리프트 또는 이상 징후 감지
GRL
가드레일 레이어: 입력 정제 및 재구성을 통해 적대적 페이로드가 코어 모델에 도달하기 전에 무력화

기밀 컴퓨팅 (TEE)

금융, 헬스케어, 국방 분야를 위한 솔루션: 하드웨어 기반의 신뢰 실행 환경(TEE)이 사용 중 데이터를 보호합니다. 모델 가중치와 프롬프트는 격리된 엔클레이브 내에서만 복호화되며, 루트 권한이 있는 클라우드 관리자에게도 보이지 않습니다.

SGX
애플리케이션 레벨 격리
TDX
가상 머신 레벨 암호화
H100/B200
랙 스케일 기밀 GPU
CC OCI
암호화된 컨테이너 이미지

상호 증명: 모델 제공자는 순수 TEE를 확인하고, 최종 사용자는 승인된 소프트웨어를 확인합니다. 제로 트러스트 기반.

Veriprajna 시큐어 ML 파이프라인

모델 수집부터 프로덕션 추론에 이르기까지 모든 단계는 암호학적 검증, 행위 모니터링 및 제로 트러스트 격리에 의해 통제됩니다.

01

수집 및 격리

모든 외부 모델을 격리된 격리 구역으로 라우팅. 공용 허브에서 프로덕션으로의 직접 경로 차단.

02

정적 분석

심층 바이트코드 스캔. 포맷 검증. Pickle 오프코드 분석. SafeTensors 변환.

03

행위 샌드박스

격리된 컨테이너에서의 동적 테스트. 외부 송신 트래픽, 시스템 콜, 비정상 출력 모니터링.

04

서명 및 등록

HSM 기반 서명. ML-BOM 생성. 전사 AI 자산 레지스트리에 등록.

05

모니터링 추론

어드미션 컨트롤러 + TEE + 가드레일 레이어 + 지속적 출력 검증.

AI 보안 + 소프트웨어 공급망 = 하나의 문제

AI 시스템은 오픈 소스 공급망 공격의 표적이 되는 동일한 CI/CD 파이프라인을 통해 구축 및 배포됩니다. 모델이 안전하더라도 Python 런타임이 침해되면 시스템 전체가 뚫립니다. 훈련 컨테이너 이미지가 오염되면 가중치를 신뢰할 수 없습니다.

‘소프트웨어 자산’과 ‘AI 자산’ 사이의 인위적인 구분은 공격자가 악용할 수 있는 위험한 공백입니다.

가중치 전용 로딩: 실행 가능한 직렬화 비활성화. SafeTensors를 기본 포맷으로 적용.
격리된 실행기: 최소한의 네트워크 접근과 엄격한 아웃바운드 제어를 갖춘 컨테이너화된 추론.
기계론적 해석 가능성: 배포 전 모델 가중치를 감사하여 잠재적 백도어 트리거 식별.
통합 출처 관리: 모델, 데이터셋, 오픈소스 종속성, 인프라를 동시에 관리 및 검증.
FAQ

자주 묻는 질문

Hugging Face와 같은 공개 저장소의 AI 모델 파일이 보안 위험이 되는 이유는 무엇인가요?

PyTorch 및 scikit-learn에서 사용하는 Python의 Pickle 직렬화 포맷은 역직렬화 중에 임의의 코드를 실행할 수 있는 스택 기반 가상 머신을 구현합니다. 공격자는 __reduce__ 메서드를 조작하여 개발자가 torch.load()를 실행하는 순간 활성화되는 리버스 셸을 주입합니다. JFrog 연구원들은 Hugging Face에서 100개 이상의 무기화된 모델을 발견했습니다. PickleScan과 같은 정적 스캐너는 3개의 알려진 제로데이 우회 취약점이 존재하며 오탐률이 96%에 달해 탐지 수단으로 신뢰할 수 없습니다.

대규모 언어 모델을 손상시키는 데 몇 개의 오염된 문서가 필요한가요?

훈련 코퍼스의 단 0.00016%에 불과한 250개의 오염된 문서만으로도 130억 파라미터 모델을 영구적으로 손상시킬 수 있습니다. 훈련 중 약 50회의 트리거가 발생하면 가중치 공간에 백도어가 영구적으로 인코딩됩니다. 이후 수백만 개의 정제된 샘플을 추가해도 학습된 트리거-응답 연결은 덮어쓰이지 않습니다. 이러한 '슬리퍼 에이전트'는 모든 표준 벤치마크를 통과하며 특정 트리거 토큰을 만났을 때만 활성화됩니다.

ML 소프트웨어 자재명세서(ML-BOM)란 무엇이며 엔터프라이즈 AI에 왜 필요한가요?

ML-BOM(Machine Learning Bill of Materials)은 기존 SBOM을 확장하여 모델 출처, 데이터 계보, 학습 방법론, 프레임워크 종속성, 암호학적 증명을 포착합니다 (CycloneDX 및 SPDX 3.0 AI 프로파일 기반). PyTorch나 기타 종속성에서 CVE가 발견되었을 때 신속한 취약점 패치를 지원합니다. HSM 기반 암호학적 모델 서명과 결합되어 유효한 서명이 있는 승인된 모델만 프로덕션에 도달하도록 보장하며, 추론 엔진은 서명이 유효하지 않은 모델의 로드를 거부합니다.

귀사의 모델은 검증되었습니까, 아니면 단순히 다운로드되었습니까?

‘요행에 기댄 운영’과 검증 가능한 복원력 사이의 차이는 단 하나의 아키텍처적 결정에 달려 있습니다.

Veriprajna는 취약한 섀도우 AI에서 암호학적으로 보호되고 하드웨어로 뒷받침되는 Deep AI 스택으로의 전환을 엔지니어링하여 AI 배포를 예측 가능하고 감사 가능하며 신뢰할 수 있도록 만듭니다.

AI 보안 평가

  • ML 공급망 취약점 감사
  • 섀도우 AI 발견 및 개선 로드맵
  • 모델 직렬화 포맷 위험도 평가
  • NIST AI 100-2 컴플라이언스 격차 분석

Deep AI 엔지니어링

  • 프라이빗 모델 허브 및 ML-BOM 파이프라인 설계
  • HSM 통합을 통한 암호학적 모델 서명
  • 민감 추론을 위한 기밀 컴퓨팅 배포
  • 지속적 런타임 모니터링 및 가드레일 아키텍처
WhatsApp으로 문의
전체 기술 화이트페이퍼 읽기

전체 엔지니어링 보고서: 직렬화 공격 분류, AI 킬 체인 방어, ML-BOM 사양, 암호학적 서명 아키텍처, 기밀 컴퓨팅 배포 패턴, NIST AI 100-2 구현 가이드.

소셜

다른 채널에도 게시됨