문제점
2024년 2월, JFrog 보안 연구진은 가장 인기 있는 머신러닝 공개 저장소 중 하나인 Hugging Face에서 100개 이상의 악성 AI 모델을 발견했습니다. 이 모델들은 단순히 결함이 있는 수준이 아니었습니다. 무기화되어 있었습니다. 개발자가 이 중 하나를 다운로드하여 표준 명령어로 로드하자, 모델은 원격 서버로 은밀하게 백도어 — 리버스 셸(reverse shell) — 을 열었습니다. 공격자는 해당 개발자의 시스템에 즉시 접근 권한을 확보했습니다.
"baller423"이라는 사용자가 업로드한 한 특정 모델은 피클(pickle)이라는 일반적인 파일 형식을 사용하여 로딩 과정에서 코드를 삽입했습니다. 데이터 과학자가 표준 torch.load() 명령어를 실행하는 순간, 악성 코드가 자동으로 실행되었습니다. 이 코드는 한국연구환경정보망(Korea Research Environment Open Network)에 속한 IP 주소로 연결되었습니다.
이것은 이론적인 위험이 아닙니다. 여러분의 팀이 매일 사용하고 있을 플랫폼에서 지금 당장 일어나고 있는 일입니다. 여러분의 조직이 공개 소스에서 AI 모델을 가져온다면 — 대부분의 조직이 그러하듯 — 인간이 육안으로 읽거나 검토할 수 없는 바이너리 파일을 들여오고 있는 것입니다. 기존 소프트웨어 코드와 달리, AI 모델 가중치는 불투명한 구조체입니다. 악의적인 동작은 수백만 개의 수치 파라미터 속에 숨어 있습니다. 여러분의 기존 코드 리뷰 프로세스로는 이를 전혀 잡아낼 수 없습니다. AI 공급망은 이제 여러분의 기술 스택에서 가장 취약하고 가장 거버넌스가 부재한 영역입니다.
이것이 여러분의 비즈니스에 중요한 이유
이에 따른 재무적·규제적 위험 노출은 실재하며 계속 커지고 있습니다. 백서 연구에서 제시된 다음 수치들을 살펴보십시오:
- 조직의 83%는 자동화된 AI 보안 제어가 부족합니다. 17%만이 자동화된 방어 체계를 갖추고 있습니다. 연구진의 표현을 빌리자면, 나머지는 "눈을 가린 채 운영(operating blind)"하고 있는 셈입니다.
- 섀도우 AI(Shadow AI) — 직원에 의한 승인되지 않은 AI 도구 사용 — 가 엔터프라이즈 AI 사용량의 90%를 차지합니다. 여러분의 IT 및 보안 팀은 현재 조직 내 AI 활동의 대부분을 파악하지 못하고 있을 가능성이 높습니다.
- 검증되지 않은 AI 도구와 관련된 사고는 데이터 침해 비용을 평균 ,000 증가시킵니다. 이는 거버넌스 없는 AI 도입에 대해 지불하는 대가입니다.
- 실질적인 기술적 제어를 갖춘 AI 거버넌스를 구현한 기업은 12%에 불과합니다. 또 다른 56%는 "준비되었다"고 말하지만 이를 뒷받침할 강제 메커니즘이 부족합니다.
- 조직의 86%는 AI가 내부에서 데이터를 어떻게 이동시키는지에 대한 가시성을 전혀 확보하지 못하고 있습니다. 데이터 흐름을 볼 수 없다면 이를 보호하거나 규정 준수를 입증할 수 없습니다.
여러분의 이사회와 규제 기관의 질문은 명확합니다. 감사관에게 현재 환경에서 실행 중인 AI 모델이 정확히 무엇인지, 출처가 어디인지, 어떤 데이터를 다루는지 보여줄 수 있습니까? 그럴 수 없다면 NIST AI 100-2와 같은 신흥 프레임워크 하에서 컴플라이언스 공백에 직면하게 됩니다. 또한 아무도 검증하지 않은 AI 모델이 공격 벡터가 되었기 때문에 전혀 예상치 못한 침해 사고로 인한 평판 손상에 직면할 수도 있습니다.
내부에서 실제로 벌어지고 있는 일
이 위협을 포착하기가 왜 그토록 어려운지 이해하려면 AI 모델을 봉인된 레시피 상자라고 생각해 보십시오. 기존 소프트웨어는 일반 텍스트로 작성된 레시피와 같아서 모든 지침을 읽고 위험한 부분을 발견할 수 있습니다. 반면 AI 모델은 내부에 수백만 개의 미세한 다이얼이 들어 있는 잠긴 상자입니다. 다이얼이 출력을 생성하지만 상자를 열고 지침을 읽을 수는 없습니다. 오염된 모델은 특정 트리거가 숨겨진 동작을 활성화하기 전까지는 깨끗한 모델과 완전히 동일하게 보이고 작동합니다.
이를 데이터 오염(data poisoning)이라고 부르며, 그 이면의 수학적 원리는 놀라울 정도입니다. Anthropic과 NVIDIA의 AI 레드팀 연구원들은 훈련 데이터의 단 0.00016% — 방대한 데이터셋 중 약 250개의 문서 — 만 오염시켜도 130억 개 파라미터 모델이 영구적으로 손상됨을 보여주었습니다. 오염된 데이터가 일단 모델의 가중치에 녹아들면 깨끗한 데이터를 더 추가해도 문제가 해결되지 않습니다. 백도어는 영구적으로 남습니다.
이러한 오염된 모델은 "슬리퍼 에이전트(sleeper agents)"처럼 작동합니다. 이들은 모든 표준 테스트와 벤치마크를 통과합니다. 여러분의 QA 환경에서는 정상적으로 작동합니다. 그러나 고유한 텍스트 문자열, 특정 이미지 패턴, 심지어 비트 수준의 입력 조작과 같은 특정 트리거를 만나면 모델은 악의적인 모드로 전환됩니다. 이는 인증 우회, 민감한 데이터 유출, 또는 다운스트림 시스템이 자동으로 실행하는 유해 코드 생성을 의미할 수 있습니다.
위험은 모델 자체에만 국한되지 않습니다. 여러분을 보호하도록 고안된 보안 스캐너조차 실패하고 있습니다. JFrog는 AI 모델 검증에 널리 사용되는 도구인 PickleScan에서 세 가지 제로데이 취약점을 발견했습니다. 공격자는 파일 확장자를 조작하여 손상된 모델을 "안전한" 것처럼 보이게 만들 수 있었습니다. 연구에 따르면 현재 스캐너 알림의 최대 96%가 오탐(false positives)이며, 이는 보안 팀이 실제 위협에 둔감해지게 만듭니다.
무엇이 통하고 (무엇이 통하지 않는가)
기대에 미치지 못하는 세 가지 일반적인 접근 방식부터 살펴보겠습니다:
- 공개 저장소의 신뢰도 점수에 의존하는 것. Hugging Face는 검증된 소프트웨어 공급업체가 아닙니다. 그곳에서 발견된 100개 이상의 악성 모델은 인기와 가용성이 결코 안전을 의미하지 않음을 증명합니다.
- 자동화된 강제 조치 없이 AI 거버넌스 정책만 작성하는 것. 정책 문서가 새벽 2시에 개발자가 검증되지 않은 모델을 다운로드하는 것을 막지는 못합니다. 기술적 장벽이 없다면 직원의 77%는 공개 AI 도구에 독점 데이터를 계속 붙여넣을 것입니다.
- AI 모델 파일에 표준 코드 스캐너를 실행하는 것. 기존의 정적 분석 도구는 모델 가중치를 검사할 수 있는 맥락이 부족합니다. 이러한 도구는 수치 파라미터에 숨겨진 백도어나 모델 메타데이터에 내장된 악성 템플릿을 탐지할 수 없습니다.
실제로 효과가 있는 것은 모든 AI 모델을 잠재적으로 악의적인 실행 코드로 취급하는 것입니다. 3단계 아키텍처 원칙은 다음과 같습니다:
입력 — 머신러닝 소프트웨어 자재명세서(ML-BOM) 생성. 모델이 환경에 진입하기 전에 모델의 출처, 훈련 데이터, 프레임워크 종속성, 암호화 서명에 대한 위변조 방지 기록을 생성하십시오. 이를 모든 AI 아티팩트에 대한 보관 연속성(chain-of-custody) 문서로 생각하십시오. CycloneDX 및 SPDX 3.0과 같은 표준은 바로 이 목적을 위한 AI 전용 프로필을 지원합니다. 여러분의 데이터 출처 및 추적성 프랙티스 가 여기서 기초를 형성합니다.
처리 — 로드 시점에 암호화 검증 강제. AI 모델을 실행하는 시스템인 추론 서버에는 모델이 메모리에 로드되기 전에 신뢰할 수 있는 레지스트리와 비교하여 모든 모델의 디지털 서명을 확인하는 "어드미션 컨트롤러(Admission Controller)"가 포함되어야 합니다. 이는 여러분 조직 고유의 키로 서명된 모델만 실행될 수 있음을 의미합니다. 하드웨어 보안 모듈(HSM)을 사용하여 해당 키를 관리하십시오. 실행 코드를 허용하지 않는 형식인 SafeTensors를 위해 pickle 형식을 전면 금지하십시오.
출력 — 런타임에 모델 동작을 지속적으로 모니터링. 백도어 활성화를 알리는 드리프트나 이상 징후를 감지하기 위해 모델 출력을 깨끗한 검증 기준선(baseline)과 비교하십시오. 쿼리가 모델에 도달하기 전에 이를 재구성하여 정교하게 제작된 트리거 페이로드를 무력화하는 입력 정제(sanitization) 계층을 적용하십시오. 모델 추출 공격을 방지하기 위해 쿼리 속도를 제한(rate-limit)하십시오.
감사 추적(audit trail)의 이점은 이 접근 방식을 여러분의 컴플라이언스 팀에 매우 가치 있게 만드는 핵심 요소입니다. 모든 모델에는 서명된 ML-BOM이 있습니다. 모든 배포에는 검증된 서명 체인이 존재합니다. 모든 추론은 모니터링된 출력을 가집니다. 규제 기관이나 감사관이 "이 AI 모델이 안전하다는 것을 어떻게 아는가?"라고 물을 때 정책 문서가 아닌 암호화된 증거를 제시할 수 있습니다.
다음과 같은 AI 보안 및 복원력 분야의 조직에게 있어 이는 더 이상 선택 사항이 아닙니다. AI 보안과 소프트웨어 공급망 보안의 융합은 기존 CI/CD 파이프라인 보호 조치가 모델 아티팩트까지 포괄하도록 확장되어야 함을 의미합니다. 모델이 안전하더라도 이를 실행하는 Python 라이브러리가 손상되면 여러분의 시스템은 여전히 침해당한 것입니다. 소프트웨어와 AI 자산 전반에 걸쳐 보안 평가 및 강화 에 대한 통합된 접근 방식을 취하는 것만이 이러한 격차를 메울 수 있는 유일한 방법입니다.
전체 기술 분석 읽기 를 통해 상세한 구현 지침을 확인하거나, 인터랙티브 버전 살펴보기 를 통해 이러한 제어 장치가 여러분의 특정 환경에 어떻게 매핑되는지 확인하십시오.
핵심 요점
- JFrog 연구진은 2024년 Hugging Face에서 개발자가 로드하는 즉시 코드를 실행하는 백도어가 포함된 100개 이상의 악성 AI 모델을 발견했습니다.
- 훈련 데이터의 단 0.00016%만 오염시켜도 130억 개 파라미터 AI 모델이 영구적으로 손상되며, 이 백도어는 추가적인 클린 훈련 후에도 유지됩니다.
- 기업의 83%는 자동화된 AI 보안 제어가 부족하며, 엔터프라이즈 AI 사용량의 90%는 IT의 가시성 밖에서 섀도우 AI(Shadow AI)로 발생합니다.
- 검증되지 않은 AI 도구는 데이터 침해 사고 발생 시 평균 ,000의 비용을 가중시킵니다.
- 머신러닝 소프트웨어 자재명세서(ML-BOM)를 포함하여 암호화 서명된 모델 아티팩트는 규제 당국이 점점 더 요구하는 감사 가능한 증명 추적을 제공합니다.
결론
여러분의 AI 공급망은 기존 소프트웨어 공급망보다 안전하지 않을 가능성이 거의 확실하며, 공격자들도 이를 잘 알고 있습니다. 검증되지 않은 공개 모델, 보이지 않는 섀도우 AI(Shadow AI), 그리고 오탐으로 가득 찬 보안 스캐너의 결합은 대부분의 기업이 아직 측정조차 하지 못하는 위험 노출을 초래합니다. 여러분의 AI 공급업체에 물어보십시오. 지금 우리 환경에서 실행 중인 모든 모델에 대해 암호화 서명과 완전한 출처 추적 체인을 보여줄 수 있습니까?