보안 평가 및 하드닝

실제 공격자의 침투 방식 그대로 AI 시스템을 테스트하고 모델 추출부터 공급망 침해까지 식별된 공격 경로에 맞서 시스템을 하드닝합니다.

저희의 접근 방식은 실제 공격자가 하는 방식 그대로 AI 시스템을 공격하고, 평가를 통해 식별된 공격 경로에 맞서 시스템을 하드닝하는 것입니다 — 모델 추출부터 공급망 침해에 이르기까지 말입니다. 기존의 모의 침투 테스트는 귀사의 API, 인프라 및 인증 흐름을 포괄하지만, 공격자가 미세조정된 모델을 탈취하거나 종속성 체인에 백도어를 심거나 RAG 파이프라인을 하이재킹할 수 있는지는 전혀 테스트하지 않습니다. 이러한 평가 방법론은 AI 시스템이 실패하는 특유의 방식에 맞추어 특별히 구축되어야 합니다.

귀사의 보안 팀이 한 번도 테스트해 본 적 없는 공격 표면

기존의 모의 침투 테스트는 귀사의 API, 인프라 및 인증 흐름을 포괄합니다. 하지만 공격자가 미세조정된 모델을 추출할 수 있는지는 테스트하지 못합니다. 바로 50,000 개의 정교하게 구성된 쿼리를 통해서 말입니다. 또한 오염된 LoRA 어댑터 가 귀사의 HuggingFace 종속성 체인에 3개월 전 백도어를 심어두었는지 감지하지 못합니다. 귀사의 RAG 파이프라인이 검색된 문서에 임베딩된 지침을 실행할지 여부도 평가하지 않습니다. 이것이 바로 프로덕션 환경의 AI 시스템을 실제로 침해하는 공격 경로입니다.

이것은 학술 컨퍼런스 발표에서나 나오는 이론적 위험이 아닙니다. Protect AI가 발견한 바에 따르면 51,700개 모델에 걸쳐 352,000개의 의심스러운 파일 이 2025년 4월 HuggingFace에 존재했습니다. AI 기반 공격은 전년 대비 89% 증가했으며, 이때 97% 에 달하는 침해 조직이 자사 AI 시스템에 대한 기본적인 접근 제어조차 갖추지 못했습니다. Mercor 공급망 공격 은 2026년 초 단 하나의 오픈소스 종속성을 통해 수천 개의 기업을 침해했습니다.

저희가 실제로 테스트하는 항목 — 그리고 대부분의 평가가 놓치는 것

저희는 평가 체계를 MITRE ATLAS 프레임워크를 기반으로 구성합니다. 이 프레임워크는 현재 16개 전술에 걸친 84개 기법 을 통해 특히 AI 시스템을 표적으로 삼는 공격을 분류하고 있습니다. 하지만 프레임워크는 지도일 뿐, 테스트 자체가 아닙니다. 저희의 방법론은 단지 항목을 체크하는 데 그치지 않고, 프레임워크에 수록된 공격을 실제로 실행하도록 구축되었습니다.

LLM 배포 및 프롬프트 인젝션

저희는 모든 수집 경로를 통해 간접 프롬프트 인젝션을 테스트합니다: RAG 검색, 도구 출력, 사용자 업로드 문서, 에이전트에 입력되는 이메일 콘텐츠 등이 포함됩니다. 직접 인젝션이 헤드라인을 장식하곤 하지만, Anthropic은 2026년 2월 직접 인젝션 지표를 완전히 폐기했습니다 — 검색 컨텍스트를 통한 간접 인젝션이야말로 프로덕션 시스템을 실제로 무너뜨리는 공격이기 때문입니다. 저희는 또한 다중 턴 조작, 시스템 프롬프트 추출, 그리고 귀사가 도입한 모든 가드레일 스택의 구체적인 실패 모드를 테스트합니다.

모델 레벨 보안

저희는 귀사의 API를 대상으로 구조화된 쿼리 캠페인을 실행하고 공격자가 모델의 행동을 얼마나 복제할 수 있는지 측정하여 추출 위험을 평가합니다. 그래디언트 기반 방법(모델에 접근할 수 있는 경우)과 전이 기반 블랙박스 공격(실제 공격자의 작업 방식)을 모두 활용하여 적대적 견고성을 평가합니다. 직접 학습 데이터와 이를 공급하는 업스트림 종속성을 모두 점검하여 학습 파이프라인의 데이터 오염 취약점을 감사합니 다(자세한 내용은 모델 오염으로부터 기업을 보호하는 방안에 관한 당사의 연구 참조).

공급망 무결성

저희는 모든 모델 아티팩트의 출처를 역추적합니다: 사전 학습된 가중치, 미세조정 데이터셋, 어댑터 레이어, 서빙 프레임워크 버전을 포함합니다. 귀사의 ML 인프라에서 알려진 취약점을 점검하며 — PyTorch, vLLM, Triton Inference Server는 모두 2025–2026년에 CVE가 발생했습니다 — 모델 직렬화 시 안전한 형식을 사용하는지 검증합니다. $12 billion 에 달하는 2025년 손상된 ML 모델 관련 손실은 직접적인 모델 공격이 아니라 압도적으로 공급망 공격에서 비롯되었습니다(다음 참조: ML 공급망 수명 주기 보안에 관한 당사의 연구).

에이전틱 시스템

저희는 다음이 정의하는 공격 표면을 테스트합니다: OWASP의 Agentic AI Top 10 에서 명시된 목표 하이재킹, 도구 오용, 신원 남용, 메모리 오염, 다중 에이전트 워크플로 전반의 연쇄적 장애가 이에 해당합니다. 2026년 OpenClaw 위기 — 즉 21,000+개의 인스턴스 에 달하는 135,000-star AI 에이전트가 치명적인 취약점에 노출된 사건 — 는 이러한 테스트 없이 에이전트가 출시될 때 어떤 일이 벌어지는지를 여실히 보여주었습니다(자세한 내용은 인간-AI 프론티어 보안에 관한 당사의 연구 참조).

시스템의 운영 방식을 근본적으로 바꾸는 하드닝

개선 없는 평가는 값비싼 PDF에 불과합니다. 저희의 접근 방식은 하드닝 제어 장치를 귀사의 시스템에 직접 구축하는 것입니다.

  • 추론 계층 방어: 추출 패턴 트래픽(체계적인 입력 커버리지, 경계 탐색, 프로그래밍 방식의 패러프레이즈 스윕)을 식별하고 이를 정당한 사용과 구분하는 쿼리 이상 탐지. 입력 유효성 검사 파이프라인은 시맨틱 공격을 놓치고 정당한 쿼리를 차단하는 범용 정규식 필터가 아니라, 귀사의 특정 위협 모델에 맞춰 정밀하게 조정됩니다.
  • 공급망 하드닝: 어떠한 모델 아티팩트라도 배포 파이프라인에 들어가기 전에 아티팩트의 출처를 확인하고, 직렬화 형식을 검증하며, 알려진 악성 패턴을 스캔하고 서명 요구사항을 강제하는 모델 검증 파이프라인 — 여기에 손상된 업스트림 패키지가 프로덕션에 도달하기 전에 포착하는 종속성 모니터링이 추가됩니다.
  • 에이전틱 시스템 하드닝: 도구 접근에 대한 권한 경계 설정, 에이전트 단계 간 출력 검증, 그리고 에이전트의 실행 패턴이 예상된 워크플로에서 벗어나는 시점을 감지하는 행동 모니터링.

기존의 SIEM은 인간 행동의 이상을 감지하도록 구축되었습니다. 무려 10,000개의 쿼리 를 순차적으로 실행하는 에이전트는 공격자의 통제 하에 작동하는 경우에도 이러한 시스템에는 정상적인 동작으로 보입니다.

이 서비스가 필요하지 않은 경우

미세조정, RAG, 도구 사용이 없으며 프롬프트에 민감한 데이터가 포함되지 않은 상태에서 관리형 API(OpenAI, Anthropic, Google)만 호출하는 경우, 귀사의 보안 위험은 API 키 관리 및 데이터 처리에 국한됩니다. 표준 애플리케이션 보안 검토만으로도 충분히 대응 가능하며 — AI 전용 보안 평가는 필요하지 않습니다.

외부 공개 API와 재학습 파이프라인 없이 내부에서만 실행되는 단순 분류기 모델의 경우, 공격 표면이 제한적이므로 간략한 위협 모델 검토만으로 적절합니다. 방화벽 뒤에 있는 내부 감성 분류기에 대한 전면적인 적대적 견고성 테스트는 $500의 위험을 막기 위해 $30,000를 지출하는 것에 불과합니다.

저희가 이 점을 분명히 말씀드리는 이유는 단기적인 매출보다 신뢰성이 더 중요하기 때문입니다. 이 작업이 필요한 조직은 스스로를 잘 알고 있습니다: 미세조정된 모델, 외부 콘텐츠를 처리하는 RAG 파이프라인, 도구 접근 권한을 가진 에이전틱 시스템, 규제 산업의 모델, 또는 금융 및 안전에 중대한 영향을 미치는 결정을 내리는 AI 시스템을 운영하는 곳입니다.

규제 압박은 실재하며 마감 기한이 정해져 있습니다

EU AI Act 집행은 2026년 8월에 시작됩니다. 고위험 AI 시스템은 문서화된 위험 관리, 기술적 견고성 테스트, 데이터 거버넌스 제어를 요구합니다. 미준수 시 부과되는 과징금은 최대 전 세계 연간 매출액의 7% 또는 EUR 35 million에 달합니다. NIST는 2025년 12월 AI를 위한 사이버보안 프레임워크 프로필을 발표했습니다, 이는 AI 특유의 위험을 CSF 2.0 제어 항목에 매핑합니다. 이러한 프레임워크는 이제 조달 요건 및 이사회 수준의 리스크 검토에 본격적으로 등장하고 있습니다.

문제는 단 하나의 프레임워크만으로는 모든 것을 포괄할 수 없다는 점입니다. 저희는 귀사의 규제 기관, 감사인, 고객이 요구하는 프레임워크에 맞추어 평가 결과를 매핑합니다 — 이는 단순한 체크박스 작성 행위가 아니라 실제 테스트에서 도출된 결과이므로 컴플라이언스 요건을 확실하게 충족하는 입증 자료가 됩니다.

프레임워크제공 항목
MITRE ATLAS공격 기법 매핑
OWASP LLM Top 10취약점 범주 분류
NIST AI RMF거버넌스 구조 제공
ISO 42001관리 시스템 처리
EU AI Act법적 의무 부과

플랫폼 도구 vs. 맞춤형 평가

자동화된 AI 보안 플랫폼(HiddenLayer, Mindgard, Giskard)은 알려진 공격 패턴을 대규모로 실행합니다. 초기 평가 이후 지속적인 회귀 테스트를 수행하는 데 유용하지만, 초기 평가 자체를 대체할 수는 없습니다. 스캐너는 귀사의 비즈니스 로직을 이해하지 못하고, 어떤 모델 출력이 안전에 치명적인 결과를 초래하는지 알지 못하며, 위협 모델이 실제 배포 아키텍처와 일치하는지 평가할 수 없습니다.

저희는 이러한 도구가 가치를 더하는 영역에서 적절히 활용합니다. 테스트할 항목이 확립된 후에는 지속적인 자동화 레드팀을 CI/CD 파이프라인에 통합해야 합니다. 그러나 귀사의 특정 시스템에서 가장 중요한 공격 경로를 찾아내려면 AI 실패 모드와 귀사의 운영 컨텍스트를 모두 깊이 이해하는 전문가가 필요합니다.

다양한 AI 벤더(OpenAI, Anthropic, Google, 오픈소스 모델)를 함께 운영하는 조직의 경우, 저희는 각 공급업체의 보안 경계를 독립적으로 평가하고 이들 사이에 데이터가 흐르는 통합 지점을 테스트합니다. 멀티 벤더 스택의 공격 표면은 각 벤더 위험의 단순한 합이 아닙니다 — 바로 상호작용 계층이며, 한 제공자의 보안 보장에 대한 가정이 다른 제공자로 데이터를 전달하는 과정에서 무너지는 지점입니다.

핵심 요약

  • AI 시스템은 표준 침투 테스트가 결코 다루지 못하는 방식으로 실패합니다 — 모델 추출, 오염된 LoRA 어댑터, 간접 프롬프트 인젝션, 에이전틱 목표 하이재킹 등이 여기에 해당합니다.
  • 저희는 네 가지 표면(LLM 배포, 모델 레벨 보안, 공급망, 에이전틱 시스템) 전반에 걸쳐 테스트를 진행하며, MITRE ATLAS(16개 전술, 84개 기법)를 기반으로 구조화하되 체크리스트가 아닌 실제 공격을 기반으로 실행합니다.
  • 평가에는 개선 조치가 포함됩니다: PDF 문서로 전달되는 것이 아니라 추론 계층, 공급망, 에이전틱 하드닝 제어 장치가 귀사의 시스템에 직접 구축됩니다.
  • 저희는 평가 결과를 MITRE ATLAS, OWASP LLM Top 10, NIST AI RMF, ISO 42001 및 EU AI Act에 매핑합니다 — EU AI Act는 2026년 8월부터 집행이 시작되며 최대 매출액의 7% 또는 EUR 35 million의 과징금이 부과됩니다.
  • 모든 배포 환경에 이 서비스가 필요한 것은 아닙니다. 관리형 API 및 단순 내부 분류기에는 필요하지 않지만, 미세조정된 모델, 외부 콘텐츠를 처리하는 RAG, 도구를 사용하는 에이전트, 규제 대상 또는 안전 필수 AI 시스템에는 반드시 필요합니다.

보안 평가 및 하드닝

자주 묻는 질문

자주 묻는 질문

AI 전용 보안 평가 비용은 얼마인가요?

AI 보안 평가는 범위가 지정된 LLM 애플리케이션 검토의 경우 $15,000부터 모델 레벨 공격, 공급망 감사 및 에이전틱 시스템 테스트를 포괄하는 전면적인 레드팀 참여의 경우 $80,000+까지 다양합니다. 중견기업 대상 컨설팅 요율은 컨설턴트 1인당 일일 $1,500-$3,500이며, 최고 수준의 부티크는 일일 $4,000-$7,000을 청구합니다. 적절한 범위는 배포 아키텍처에 따라 달라집니다: 미세조정이 없는 관리형 API 호출은 도구 접근 권한을 갖추고 에이전틱 워크플로를 처리하는 미세조정 모델보다 훨씬 적은 테스트가 필요합니다.

일반 모의 침투 테스트에서는 다루지 않는 AI 보안 평가만의 테스트 항목은 무엇인가요?

기존 모의 침투 테스트는 API 엔드포인트, 인증, 인프라 및 애플리케이션 로직을 다룹니다. AI 보안 평가는 모델 고유의 공격 벡터를 추가합니다: 적대적 입력 조작, 구조화된 쿼리 캠페인을 통한 모델 추출, 학습 데이터 오염 탐지, 프롬프트 인젝션(직접 인젝션 및 RAG 검색을 통한 간접 인젝션 모두 포함), 모델 아티팩트에 대한 공급망 무결성, 그리고 에이전틱 시스템의 경우 다단계 워크플로를 통한 목표 하이재킹, 도구 오용 및 권한 상승 등을 검증합니다. 이러한 공격 경로는 표준 침투 테스트 프레임워크에서는 다루지 않는 ML 특화 방법론을 필요로 합니다.

누군가 API를 통해 귀사의 미세조정된 모델을 실제로 훔칠 수 있나요?

예, 가능합니다. 모델 추출 공격은 체계적인 쿼리를 통해 모델의 행동을 복제합니다. 미세조정된 분류기의 경우, 수천 번의 쿼리만으로도 기능적으로 동일한 복제본을 생성할 수 있습니다. 대규모 언어 모델의 경우 전체 추출은 더 어렵지만 미세조정 동작의 부분적 추출은 충분히 가능합니다. 스크래핑 수준의 쿼리 트래픽은 2025-2026년에 전 세계 API 트래픽의 중앙값 20%에 달했습니다. 방어책으로는 단순한 속도 제한을 넘어서는 쿼리 패턴 분석, 추출 패턴의 행동 핑거프린팅, 워터마킹 등이 있지만, 현재의 워터마킹 방식은 출력 패러프레이징을 통해 제거될 수 있습니다.

EU AI Act 준수를 위해 AI 보안 테스트가 필요한가요?

귀사의 AI 시스템이 EU AI Act에 따라 고위험으로 분류된다면 필요합니다. 제15조는 기술적 견고성 및 사이버보안 조치를 요구하며, 집행은 2026년 8월에 시작되고 과징금은 전 세계 연간 매출의 최대 7% 또는 EUR 35 million에 달합니다. NIST는 2025년 12월 AI를 위한 사이버보안 프레임워크 프로필을 발표하여 AI 특유의 위험을 CSF 2.0 제어 항목에 매핑했으며, 이는 조달 요건에서 점점 더 많이 참조되고 있습니다. 규제 기관과 법원은 제어 장치가 단순히 문서화되었는지가 아니라 실제로 테스트되었는지를 평가하므로, 실제 보안 테스트는 단순 체크박스 감사가 제공할 수 없는 컴플라이언스 입증 증거를 산출합니다.

간접 프롬프트 인젝션으로부터 RAG 파이프라인을 어떻게 보호할 수 있나요?

검색된 콘텐츠를 통한 간접 프롬프트 인젝션은 프로덕션 환경에서 가장 지배적인 LLM 공격 벡터입니다. Anthropic은 간접 인젝션이 운영상 훨씬 더 실질적인 위협이라는 이유로 2026년 2월 직접 인젝션 지표를 완전히 폐기했습니다. 방어를 위해서는 계층화된 제어가 필요합니다: 컨텍스트 윈도우에서 시스템 지침과 검색된 콘텐츠를 분리하기, 검색된 콘텐츠가 기본 모델에 도달하기 전에 2차 모델을 사용하여 평가하기, 검색에 의해 유발된 지침 수행 행동을 포착하는 출력 검증, 비정상적인 응답 패턴에 대한 지속적인 모니터링이 포함됩니다. 단 하나의 방어책만으로는 불완전합니다. 프롬프트 인젝션 성공률은 시스템 구성에 따라 50-84%에 이르므로, 심층 방어(defense-in-depth)만이 유일하게 실행 가능한 접근 방식입니다.

MITRE ATLAS, OWASP, NIST AI RMF 중 어떤 AI 보안 프레임워크를 따라야 하나요?

이들은 서로 다른 목적을 수행하며 대부분의 조직에는 세 가지 모두의 요소가 필요합니다. MITRE ATLAS(2026년 2월 기준 84개 기법, 16개 전술)는 구체적인 공격 방법을 매핑하며 기술적 평가를 구조화하는 데 가장 적합한 프레임워크입니다. OWASP LLM Top 10은 취약점 범주를 분류하고 무엇을 테스트해야 하는지 안내합니다. NIST AI RMF는 거버넌스, 매핑, 측정, 관리(Govern, Map, Measure, Manage) 기둥을 통해 거버넌스 구조를 제공하며 조달 기준으로 점점 더 많이 활용됩니다. ISO 42001은 관리 시스템 인증을 다룹니다. EU AI Act는 기한이 정해진 법적 의무를 부과합니다. 저희는 귀사의 규제 기관, 감사인 및 고객이 요구하는 프레임워크에 맞추어 평가 결과를 매핑합니다.

도구를 사용하는 에이전틱 AI의 경우 보안 평가는 무엇을 다루어야 하나요?

에이전틱 AI는 정적 LLM 테스트에서는 완전히 놓치는 새로운 공격 표면을 도입합니다. OWASP는 2025년 12월 에이전틱 애플리케이션 Top 10을 발표하여 목표 하이재킹, 도구 오용, 신원 남용, 메모리 오염 및 연쇄 실패를 다루었습니다. 평가는 공격자가 조작된 입력을 통해 에이전트의 목표를 변경할 수 있는지, 의도된 범위를 넘어 도구 권한을 상승시킬 수 있는지, 영구 메모리를 오염시켜 향후 행동에 영향을 미칠 수 있는지, 다중 에이전트 워크플로 전반에 걸쳐 장애를 연쇄시킬 수 있는지를 테스트해야 합니다. 귀사의 기존 SIEM 및 EDR 도구는 인간 행동의 이상을 탐지하도록 구축되었습니다. 10,000개의 쿼리를 연속해서 실행하는 에이전트는 공격자의 통제 하에 있더라도 이러한 시스템에는 정상적인 것으로 보입니다.

HuggingFace의 모델에 백도어가 설치되지 않았는지 어떻게 확인하나요?

Protect AI는 2025년 4월 HuggingFace의 51,700개 모델에 걸쳐 352,000개의 의심스러운 파일을 식별했습니다. 검증을 위해서는 직렬화 형식을 확인하고(임의 코드 실행을 허용하는 pickle 대신 Safetensors 사용), 모델 가중치 및 구성 파일에서 알려진 악성 패턴을 스캔하며, 서명 및 해시 검증을 통해 출처를 확인하고, 백도어 활성화와 관련된 트리거 패턴에 대해 모델 동작을 테스트해야 합니다. 악성 LoRA 어댑터는 크기가 작고 배포하기 쉬워 증가하는 공격 벡터입니다. 공급망 검증은 다운로드 시 수동으로 수행하는 것이 아니라 모델 배포 파이프라인에서 자동화되어야 합니다.

AI 보안 플랫폼을 구매하는 것과 컨설턴트를 고용하는 것의 차이점은 무엇인가요?

HiddenLayer, Mindgard, Giskard와 같은 AI 보안 플랫폼은 알려진 공격 패턴을 대규모로 자동화합니다. 이들은 CI/CD 파이프라인에서 지속적인 회귀 테스트를 수행하는 데 유용합니다. 하지만 비즈니스 컨텍스트를 이해하거나 어떤 모델 출력이 안전에 치명적인 결과를 초래하는지 평가하거나 아키텍처 고유의 새로운 공격 경로를 발견할 수 없으므로 초기 평가를 대체할 수는 없습니다. 올바른 접근 방식은 두 가지를 모두 활용하는 것입니다: 컨설턴트를 통해 실제 위협 표면을 식별하고 무엇이 중요한지 정의하며 하드닝 제어 장치를 구축한 다음, 평가를 통해 확립된 기준선에 맞춰 지속적인 자동화 테스트를 위해 플랫폼 도구를 사용하는 것입니다.

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.