리스크 및 컴플라이언스 담당자용4 분 소요

여러분의 AI 공급망은 이미 침해되었을 가능성이 높습니다

주요 공개 플랫폼에서 100개 이상의 악성 AI 모델이 발견되었으며, 대부분의 보안 스캐너는 이를 완전히 놓쳤습니다.

문제점

2024년 2월, JFrog의 보안 연구원들은 세계에서 가장 인기 있는 AI 모델 저장소 중 하나인 Hugging Face에 100개 이상의 악성 AI 모델이 올라와 있는 것을 발견했습니다. 이들 모델 중 다수는 누군가 로드하는 즉시 코드를 실행하도록 설계된 은밀한 백도어를 포함하고 있었습니다. 일단 실행되면, 페이로드는 공격자에게 피해자의 머신에 대한 지속적인 셸(원격 접속 지점)을 제공했습니다. 공격자들은 이를 통해 내부 네트워크 전체로 이동하거나, 데이터를 탈취하거나, 학습 파이프라인을 오염시킬 수 있었습니다.

이것은 이론적인 연습이 아니었습니다. 공개 다운로드가 가능한 실제 모델들이었으며, 빠른 해결책이 필요한 여러분 팀의 개발자가 로드하기만을 기다리고 있었습니다. 모델들은 정상적으로 보였습니다. 기본적인 검사도 통과했습니다. 하지만 파일 형식 자체인 Python의 pickle 형식은 로딩 과정에서 숨겨진 코드를 실행할 수 있습니다. 악성코드를 은밀히 설치하는 Word 문서를 여는 것과 같다고 생각해 보십시오. 다만 이 경우, 그 "문서"가 바로 여러분의 팀이 신뢰하는 AI 모델이라는 점이 다를 뿐입니다.

이러한 종류의 위협을 포착하도록 설계된 스캐너들이 제 역할을 못 하고 있다는 사실을 깨달으면 문제는 더욱 심각해집니다. 공개 저장소에서 "안전하지 않음"으로 표시된 모델의 96% 이상이 오탐(false positive)인 것으로 드러났습니다. 쏟아지는 오탐 경보는 보안 팀이 경고를 무시하도록 만듭니다. 그리고 그 노이즈에 묻혀 있던 것 중, 연구원들은 표준 스캐닝 도구를 빠져나간 제로데이 위협인 25개의 실제 악성 모델을 발견했습니다.

이것이 여러분의 비즈니스에 중요한 이유

이것은 단순한 IT 문제가 아닙니다. 조직의 모든 부분에 영향을 미치는 재무적, 법적, 운영적 리스크입니다.

숫자부터 살펴보겠습니다:

  • **조직의 98%**는 업계에서 "섀도우 AI(Shadow AI)"라고 부르는 승인되지 않은 AI 도구를 사용하는 직원을 두고 있습니다. 여러분의 직원들은 검증되지 않은 모델을 거의 확실하게 다운로드하여 실행하고 있습니다.
  • **직원의 43%**가 허가 없이 민감한 데이터를 AI 도구에 공유합니다. 이는 여러분의 독점 정보, 고객 데이터, 영업 비밀이 이미 제3자 모델 내부에 들어가 있을 수 있음을 의미합니다.
  • 섀도우 AI 침해는 670,000달러 더 많은 비용을 초래합니다. 도난당한 데이터가 신경망 가중치에 각인되어 있으면 디지털 포렌식이 훨씬 어려워지기 때문에 기존 데이터 침해보다 더 큰 비용이 발생합니다.
  • **조직의 63%**는 공식적인 AI 거버넌스 정책을 갖추고 있지 않습니다. 여러분의 회사가 여기에 해당한다면, 문제가 발생했을 때 규제 기관에 내놓을 명확한 답변이 없는 것입니다.

대부분의 경영진이 들어본 적 없는 법적 리스크도 존재합니다: **모델 몰수(model disgorgement)**입니다. 이는 불법적으로 획득한 데이터로 학습되었다는 이유로 규제 당국이 기업에 AI 모델 전체를 파기하도록 강제하는 규제 구제 조치입니다. 이미 학습된 모델에서 한 사람의 데이터만 외과 수술하듯 도려낼 수는 없습니다. 여러분의 제품이 오염된 데이터로 구축된 모델에 의존한다면, 법원은 전체를 삭제하라고 명령할 수 있습니다. 여러분의 제품 라인이 하룻밤 사이에 사라지게 됩니다.

여러분의 이사회에 던져진 질문은 간단합니다. 지금 회사 내부에서 어떤 AI 모델이 실행되고 있는지 알고 있습니까? 그리고 그 모델들이 어디서 왔는지 입증할 수 있습니까?

내부에서 실제로 벌어지고 있는 일

현재의 AI 배포가 왜 취약한지 이해하려면 두 가지를 알아야 합니다. 커스터마이징 과정에서 모델이 어떻게 손상되는지, 그리고 널리 쓰이는 "래퍼(wrapper)" 접근 방식이 왜 본격적인 비즈니스 애플리케이션에서 실패하는지입니다.

첫째는 커스터마이징 문제입니다. 대부분의 기업은 Meta의 Llama와 같은 파운데이션 모델을 가져와 특정 작업에 맞게 자체 데이터로 미세조정(fine-tuning)합니다. 이는 합리적으로 들립니다. 하지만 NVIDIA의 AI Red Team은 미세조정이 원래 개발자들이 수개월에 걸쳐 구축한 안전 가드레일(safety guardrails)을 일상적으로 파괴한다는 사실을 발견했습니다. 한 테스트에서는 프롬프트 인젝션 공격에 대한 Llama 모델의 보안 점수가 단 한 번의 미세조정 후 0.95에서 0.15로 급락했습니다. 이는 "높은 복원력"에서 "거의 무방비" 상태로 추락한 것입니다.

이런 현상이 발생하는 이유는 미세조정이 해당 작업에 대한 정확도를 극대화하기 위해 모델의 내부 가중치를 조정하기 때문입니다. 그 과정에서 모델에 정교하게 학습되어 있던 안전 동작들을 덮어써 버립니다. 에어백, 잠김 방지 브레이크, 차선 유지 보조 장치가 장착된 자동차를 산 뒤, 속도를 높이려고 엔진을 튜닝하다가 실수로 모든 안전 시스템의 연결을 끊어버린 정비사에게 차를 맡겼다고 상상해 보십시오. 차는 더 빨라졌지만, 이제 위험해졌습니다.

둘째는 래퍼(wrapper) 문제입니다. 대부분의 AI 컨설팅 회사는 기업의 데이터를 OpenAI의 GPT-4와 같은 제3자 API에 연결하는 얇은 소프트웨어 계층인 래퍼를 구축합니다. 이러한 래퍼는 AI를 통제하기 위해 "시스템 프롬프트"와 필터에 의존합니다. 하지만 이는 확률 엔진에 대한 제안일 뿐, 엄격한 규칙이 아닙니다. 한 Chevrolet 대리점 챗봇은 속임수에 넘어가 76,000달러짜리 차량을 1달러에 판매하는 데 동의했습니다. Air Canada의 챗봇은 존재하지 않는 유족 할인 정책을 환각(hallucination)해 냈고, 법원은 AI의 출력에 대해 항공사의 책임을 인정했습니다. 이러한 실패는 단순한 버그가 아닙니다. 텍스트 예측 도구에 구속력 있는 비즈니스 결정을 내리도록 요구한 필연적인 결과입니다.

무엇이 통하고 (무엇이 통하지 않는가)

기대에 미치지 못하는 세 가지 일반적인 접근 방식부터 살펴보겠습니다:

  • 기본적인 모델 스캐닝: Picklescan과 같은 도구는 위험한 함수의 블랙리스트를 사용하지만, 공격자는 난독화를 통해 이를 우회하며, 96%의 오탐률로 인해 보안 팀이 실제 위협을 무시하게 만듭니다.
  • 시스템 프롬프트 및 출력 필터: 이는 Chevrolet와 DPD 사례가 입증했듯이, LLM(대규모 언어 모델, ChatGPT와 같은 도구의 기반 엔진)이 프롬프트 인젝션을 통해 무시하도록 속을 수 있는 유연한 통제책(soft controls)에 불과합니다.
  • 표준 안전 검토를 거친 미세조정: 모델이 모든 기업 벤치마크를 통과하더라도, NVIDIA의 연구에 따르면 미세조정은 "슬리퍼 에이전트(sleeper agent)" 동작을 만들어낼 수 있습니다. 즉, 99.9%의 시간 동안은 정상적으로 작동하다가 특정 트리거를 만나면 악성 모드로 전환되는 것입니다.

실제로 통하는 것은 근본적으로 다른 아키텍처입니다. 3단계 원칙은 다음과 같습니다:

  1. 입력: 방화벽 역할을 하는 시맨틱 라우팅. 사용자의 쿼리가 AI 모델에 도달하기 전에, 라우팅 계층이 벡터 유사도(새로운 요청이 이전에 식별된 공격 시도와 얼마나 유사한지 측정하는 방식)를 활용해 알려진 악성 패턴과 대조 검사합니다. 쿼리가 프롬프트 인젝션으로 보이면 모델에 도달하지 않습니다. 대신 고정된 결정론적 응답으로 리디렉션됩니다. 여러분의 AI는 공격을 전혀 "보지" 못합니다.

  2. 처리: 뉴로-심볼릭 검증. 단일 AI 모델에 의존하여 답변을 생성하는 대신 작업을 분할합니다. 신경망 계층은 자연어를 처리합니다. 기호 논리 계층 — 본질적으로 다음에 기반하여 구축된 규칙 엔진인 엔터프라이즈 데이터를 검증된 사실로 매핑하는 지식 그래프 — 가 신경망 계층이 생성하는 모든 주장을 검증합니다. 어떤 사실이 검증된 지식 그래프에 없으면 시스템은 추측하는 대신 아무것도 반환하지 않습니다. 이렇게 하여 표준 LLM 래퍼의 전형적인 범위인 1.5%~6.4%에 비해 환각률을 0.1% 미만으로 낮출 수 있습니다.

  3. 출력: 멀티 에이전트 검토. 여러분의 시스템은 조사, 작성, 비평을 위해 별도의 AI 에이전트를 사용합니다. 조사 에이전트는 지식 그래프만 조회할 수 있습니다. 작성 에이전트는 조사 에이전트가 찾은 내용만을 사용할 수 있습니다. 그런 다음 비평 에이전트가 초안에서 모든 주장을 추출하여 지식 그래프를 바탕으로 검증합니다. 어떤 단일 에이전트도 검증된 진실에서 벗어날 수 있는 권한을 갖지 못합니다.

여러분의 컴플라이언스 팀에게 핵심적인 이점은 감사 가능성(auditability)입니다. 모든 출력은 지식 그래프의 특정 노드로 거슬러 올라가 추적할 수 있습니다. 규제 기관이 "여러분의 AI가 왜 이렇게 말했는가"라고 물을 때, 정확한 데이터 소스, 정확한 규칙, 정확한 검증 단계를 보여줄 수 있습니다. 이것이 바로 아키텍처적 증명 위에 구축된 보안 평가 와 희망에 기댄 평가 사이의 차이입니다.

여러분의 조직은 또한 AI 파이프라인의 모든 데이터셋, 라이브러리, 프레임워크 버전을 나열하는 공급망 매니페스트인 AI 자재명세서(AI Bill of Materials)를 요구해야 합니다. 모든 모델 체크포인트는 암호학적으로 서명되어야 합니다. 추론 엔진은 유효하지 않은 서명이 있는 모델의 로드를 거부해야 합니다. 이는 이상적인 목표가 아닙니다. 이는 바로 AI에 투자하는 규제 대상 기업을 위한 기본 보안 관행입니다.

NIST AI 100-2 프레임워크는 이러한 위험을 분류하고 관리하기 위한 완성된 분류 체계를 제공합니다. 여기에는 프롬프트 인젝션, 데이터 포이즈닝, 모델 추출, 프라이버시 침해가 포함됩니다. 대부분의 조직은 아직 이를 도입하지 않았습니다. 그 격차가 바로 여러분이 앞서 나갈 수 있는 기회입니다.

전체 기술 분석 읽기 에서 상세한 아키텍처 사양을 확인하십시오. 또한 인터랙티브 버전 살펴보기 를 통해 위협 지형과 대응책에 대한 안내를 확인하실 수 있습니다.

핵심 요점

  • 2024년 Hugging Face에서 100개 이상의 악성 AI 모델이 발견되었으며, 스캐너 경보의 96%가 오탐으로 나타나 실제 위협이 노이즈 속으로 빠져나가고 있습니다.
  • 단 한 번의 학습 과정으로 미세조정이 한 모델의 보안 점수를 0.95에서 0.15로 떨어뜨려 안전 가드레일을 파괴했습니다.
  • 섀도우 AI 침해는 기존 침해보다 670,000달러 더 많은 비용이 들며, 조직의 98%는 승인되지 않은 AI 도구를 사용하는 직원을 두고 있습니다.
  • 오염된 데이터로 학습된 AI 모델 전체를 파기하도록 하는 법적 명령인 모델 몰수(model disgorgement)는 하룻밤 사이에 제품 라인을 완전히 없앨 수 있습니다.
  • 지식 그래프 그라운딩을 갖춘 뉴로-심볼릭 아키텍처는 표준 LLM 래퍼의 일반적인 1.5%~6.4%에 비해 환각률을 0.1% 미만으로 낮출 수 있습니다.

결론

여러분의 AI 공급망은 소프트웨어 공급망과 동일한 보안 리스크를 안고 있지만, 대부분의 조직은 이를 그렇게 다루지 않고 있습니다. 스캐너가 포착하는 것과 공격자가 배포하는 것 사이의 격차는 점점 벌어지고 있으며, 이에 잘못 대응할 경우 따르는 법적 결과에는 AI 모델의 강제 파기까지 포함됩니다. AI 공급업체에 물어보십시오: 파이프라인의 모든 모델에 대해 암호학적으로 서명된 출처 기록을 보여줄 수 있습니까? 그리고 모든 출력을 검증된 특정 데이터 소스까지 거슬러 올라가 추적할 수 있습니까?

자주 묻는 질문

자주 묻는 질문

AI 모델에 악성코드나 바이러스가 포함될 수 있나요?

네. 2024년 2월, 연구원들은 Hugging Face에서 은밀한 백도어가 포함된 100개 이상의 악성 모델을 발견했습니다. 이들 모델은 Python의 pickle 직렬화 형식을 사용하여 로드되는 즉시 임의 코드를 실행함으로써 공격자에게 피해자의 머신 및 내부 네트워크에 대한 원격 접속 권한을 부여했습니다.

AI 모델을 미세조정하면 안전성이 떨어지나요?

그렇습니다. NVIDIA의 AI Red Team은 미세조정이 파운데이션 모델에 구축된 안전 가드레일을 일상적으로 파괴한다는 사실을 발견했습니다. 한 테스트에서는 Llama 모델의 프롬프트 인젝션 방어 보안 점수가 단 한 번의 미세조정 후 0.95에서 0.15로 떨어져 안전 보호 장치가 거의 완전히 붕괴되었습니다.

섀도우 AI 침해는 기업에 얼마나 많은 비용을 초래하나요?

섀도우 AI 침해는 기존 데이터 침해보다 평균 670,000달러 더 많은 비용을 초래합니다. 이는 조직의 98%에서 직원들이 승인되지 않은 AI 도구를 사용하고 있으며, 민감한 데이터가 모델 가중치에 포함되었을 때 요구되는 디지털 포렌식이 표준 침해 조사보다 훨씬 복잡하기 때문입니다.

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.