리스크 및 컴플라이언스 담당자용4 분 소요

AI 신약 개발이 무기화될 수 있을까? 6시간 만에 가능합니다

신약 개발 AI가 일반 하드웨어에서 40,000개의 잠재적 화학무기를 생성했습니다 — 안전 필터가 막지 못하는 위협의 실체를 밝힙니다.

문제점

생명을 구하는 의약품을 찾도록 설계된 신약 개발 AI가 6시간 만에 신경작용제 VX를 포함한 40,000개의 잠재적 화학무기를 생성했습니다. Collaborations Pharmaceuticals의 연구진은 일반 소비자급 서버에서 이 실험을 진행했습니다. 그들은 시스템을 해킹하지 않았습니다. 기밀 데이터를 입력하지도 않았습니다. 단지 구성 파일에서 숫자 하나를 바꿔 AI의 목표를 "독성 최소화"에서 "독성 최대화"로 전환했을 뿐입니다. 나머지는 모델이 알아서 수행했습니다.

이 40,000개의 분자 중 상당수는 VX 자체보다 치명적인 것으로 예측되었습니다. 수천 개는 어떤 공공 데이터베이스나 정부 감시 목록에도 나타나지 않는 완전히 새로운 화합물이었습니다. AI는 ChEMBL과 같은 오픈소스 화학 데이터셋만을 사용했습니다. 필요한 컴퓨팅 파워는 소비자용 GPU를 가진 사람이라면 누구나 이용할 수 있는 수준이었습니다. 필요한 전문 지식은? 학부 수준의 컴퓨터 과학이었습니다.

이것은 이론적인 위험 평가가 아니었습니다. 스위스 연방 민간보호청(FOCP)이 주관한 격년 군비 통제 회의를 위해 준비된 실제 시연이었습니다. 해당 분자적 특성을 피하기 위해 분자를 독성으로 만드는 요인을 이해하도록 학습된 AI 모델은, 본질적으로 그 특성을 악용하는 방법 또한 알고 있었습니다. 여러분의 조직이 신약 개발, 생명공학, 또는 최적화가 물리적 안전과 직결되는 모든 분야에서 AI를 구축, 배포하거나 이에 의존하고 있다면, 이 실험은 바로 지금 여러분의 리스크 노출을 정의합니다.

이것이 여러분의 비즈니스에 중요한 이유

이로 인한 비즈니스적 파장은 연구실 수준을 훨씬 넘어섭니다. 안전하고 보안되며 신뢰할 수 있는 AI에 관한 백악관 행정명령(2023년 10월)은 AI가 화학, 생물학, 방사능, 핵무기 개발의 진입 장벽을 낮추는 것을 1등급(tier-1) 국가 안보 위협으로 명시하고 있습니다. NIST 생성형 AI 프로파일(NIST.AI.600-1)은 "화학 및 생물학적 설계 도구"를 고유한 리스크 범주로 특별히 지정했습니다. 세계 최초의 인증 가능한 AI 경영시스템 표준인 ISO 42001은 적대적 공격 복원력과 AI 시스템 안전을 위한 통제 장치를 의무화하고 있습니다.

여러분의 AI 시스템이 규제 대상 도메인을 다룬다면, 무엇이 걸려 있는지 고려해 보십시오:

  • 규제 노출: 표준 안전 필터는 생물학적 위협의 생성을 방지한다는 점을 입증할 수 없습니다. 단지 이를 필터링하려고 노력한다는 것만 보여줄 수 있을 뿐입니다. 이러한 "최선 노력(best effort)" 방식은 정부 계약이나 공공 AI 플랫폼과의 통합에 요구되는 새로운 연방 컴플라이언스 기준을 충족하지 못할 가능성이 높습니다.
  • 적대적 취약성: 연구진은 공격자가 분자의 이름 대신 구조 코드를 입력하는 방식으로 특정 독성 물질에 대해 때로는 90%를 초과하는 공격 성공률로 GPT-4 및 Claude 3와 같은 주요 AI 모델의 안전 필터를 우회할 수 있음을 입증했습니다.
  • 새로운 위협 감지 불가(Novel threat blindness): 생성된 40,000개의 화합물에는 알려진 어떤 데이터베이스에도 존재하지 않는 수천 개의 분자가 포함되어 있었습니다. 여러분의 키워드 기반 필터는 이전에 본 적 없는 것을 차단할 수 없습니다.
  • 감사 실패: ISO 42001에 따라 조직은 적대적 공격에 대한 취약성을 평가하고 통제 장치의 증거를 제시해야 합니다. NIST AI RMF에 따라 시스템 신뢰성을 정량적 지표로 측정해야 합니다. 텍스트 기반 래퍼는 이 중 어느 것도 제공하지 못합니다.

여러분의 이사회, 규제 기관, 그리고 보험사는 결국 한 가지 질문을 던질 것입니다. 여러분의 AI가 여러분을 겨냥해 악용될 수 없음을 증명할 수 있습니까? 오늘날 대부분의 조직은 이를 증명하지 못합니다.

내부에서 실제로 벌어지고 있는 일

이 위협을 해결하기가 왜 그토록 어려운지 이해하려면, 이들 AI 모델이 실제로 어떻게 작동하는지 이해해야 합니다. 그리고 이는 생각보다 간단합니다.

신약 개발을 위한 생성형 AI 모델은 화학 공간(chemical space)의 압축된 지도를 학습합니다. 모든 건물이 하나의 가능한 분자를 나타내는 도시 지도처럼 생각해 보십시오. 안전한 약물은 한 동네에 모여 있습니다. 독성 화합물은 다른 동네에 모여 있습니다. 하지만 여기에 결정적인 문제가 있습니다. "안전한" 동네와 "독성" 동네는 벽으로 분리되어 있지 않습니다. 두 지역은 명확한 경계 없이 연속적인 지형 위에 놓여 있습니다.

이것이 바로 연구자들이 "얽힘 문제(entanglement problem)"라고 부르는 것입니다. 알츠하이머병 치료제가 혈뇌장벽(BBB)을 통과할 수 있게 해주는 바로 그 분자적 특성은, 신경작용제가 표적에 도달하여 마비를 일으키게 만드는 특성과 동일한 경우가 많습니다. 단백질에 단단히 결합하는 분자의 능력인 높은 결합 친화도(binding affinity)는 치료제에서는 바람직하지만, 그 단백질이 VX의 표적인 아세틸콜린에스테라아제일 때는 치명적입니다.

의약화학자들은 미세한 구조적 변화가 독성의 급격한 변화를 초래하는 상황인 "활성 절벽(activity cliffs)"에 대해 잘 알고 있습니다. 안전한 분자에서 원자 하나만 바꾸어도 치명적인 화합물이 만들어집니다. 3차원 분자 구조가 아니라 단어와 이름에 기반해 작동하는 텍스트 기반 안전 필터는 이러한 절벽을 포착하는 데 악명 높을 정도로 취약합니다. 필터는 분자가 안전한 약물과 99% 유사해 보인다는 이유로 승인하면서, 그 분자를 치명적으로 만드는 단 하나의 치환을 놓칠 수 있습니다.

AI의 내부 모델이 미세한 구조적 차이를 구별하지 못해 독소와 안전한 약물을 동일한 지점으로 매핑하는 "표현 붕괴(representation collapse)"도 존재합니다. 모델 자체가 내부적으로 이 둘을 구별하지 못한다면, 어떤 외부 필터도 여러분을 구해줄 수 없습니다.

무엇이 통하고 (무엇이 통하지 않는가)

무엇이 실패하는지부터 살펴보겠습니다. 여러분의 조직이 지금 바로 이러한 접근 방식 중 하나에 의존하고 있을 수 있기 때문입니다.

키워드 및 이름 기반 필터: 이는 "VX"나 "사린(Sarin)" 같은 단어는 차단하지만, 누군가 분자 구조 코드를 입력하면 그대로 통과시킵니다. 사린의 SMILES 문자열은 O=P(C)(F)O입니다. 여러분의 필터는 이를 무기가 아닌 화학 표기법으로 인식합니다.

생성 후 검토 시스템: 이는 AI가 먼저 후보 물질을 생성하게 한 다음 두 번째 시스템이 이를 검토하도록 합니다. 하지만 AI는 이미 위험한 연산을 완료한 상태입니다. 감시 목록에 없는 새로운 화합물의 경우, 검토 시스템은 대조할 기준이 없어 그대로 통과시키게 됩니다.

정렬 학습 및 프롬프트 엔지니어링: 연구진은 특정 물질에 대해 90% 이상의 성공률로 주요 AI 모델의 안전 학습을 우회하는 "SMILES 프롬프팅" 공격을 시연했습니다. 안전 시스템이 영어에서 화학 표기법으로 전환하는 것만으로 무력화될 수 있다면, 그것은 안전 시스템이 아닙니다.

실제로 효과가 있는 것은 잠재 공간 거버넌스(Latent Space Governance)라는 접근 방식입니다. 이는 안전 통제를 출력 계층에서 AI 모델의 수학적 핵심부로 옮깁니다:

  1. 배포 전에 위험 구역을 매핑하십시오. 위상수학적 데이터 분석(Topological Data Analysis, TDA)이라는 수학적 기법을 사용하여 AI의 내부 지형을 매핑하고 독성 영역과 안전 영역이 정확히 어디에 존재하는지 식별합니다. 이를 통해 키워드 목록이 아닌 분자적 특성에 기반해 경계를 정의하는 "안전 위상 맵(Safety Topology Map)"이 생성됩니다. 이 맵은 이름이 아니라 형상으로 안전을 정의하므로 새로운 화합물도 정확히 포착합니다.

  2. 생성 프로세스 자체에 제약 조건을 내재화하십시오. AI가 자유롭게 생성하도록 둔 뒤 사후에 필터링하는 대신, AI의 내부 표현 위에서 직접 작동하는 경량의 "제약 비평가(Constraint Critic)" 네트워크를 학습시킵니다. 생성 과정에서 이 비평가들은 AI가 위험 구역으로 표류하고 있는지 계산합니다. 만약 위험 구역으로 향한다면, 그래디언트 기반 조향 메커니즘이 출력이 생성되기 전에 궤적을 안전한 영역으로 되돌려 놓습니다. AI는 사실상 독성 분자를 고려하더라도, 수학적으로 안전한 대안으로 전환하도록 강제됩니다.

  3. 조작에 저항하는 안전 경계를 하드코딩하십시오. 구성 파일의 숫자 하나를 바꿈으로써 전체 안전 태세가 뒤집혔던 MegaSyn 실험과 달리, 구조적 제약 조건은 추론 엔진의 아키텍처 자체에 내재화됩니다. 이를 무력화하려면 공격자는 단순히 설정을 바꾸는 것이 아니라 소프트웨어를 근본적으로 재설계해야 합니다.

여러분의 컴플라이언스 팀에게 이 접근 방식은 텍스트 기반 래퍼가 제공할 수 없는 것, 즉 유계 행동(bounded behavior)에 대한 수학적 증명을 제공합니다. 모델의 최종 출력뿐만 아니라 생성 과정에서 모델이 시도했던 모든 제약 조건 위반을 기록할 수 있습니다. 감사관에게 통계적 안전성 인증서(예: 독성 물질 생성 확률 100만 분의 1 미만)를 제시할 수도 있습니다. 이러한 증거는 ISO 42001 인증 및 NIST AI RMF 준수 를 "키워드 필터가 있다"는 변명으로는 결코 불가능한 방식으로 뒷받침합니다.

또한 이 아키텍처는 파운데이션 모델 전체를 재학습하지 않고도 위협 정의를 업데이트할 수 있음을 의미합니다. 새로운 유형의 위험 화합물이 식별되면 핵심 AI가 계속 가동되는 동안 가벼운 작업인 제약 비평가만 업데이트하면 됩니다. 특히 헬스케어 및 생명과학 분야의 조직에 있어, 위협 지형이 진화함에 따라 이러한 민첩성은 매우 중요합니다.

이어서 평가, 벤치마킹 및 레드티밍 프로세스는 취약점을 찾아내도록 설계된 진화 알고리즘과 SMILES 프롬프팅 봇을 포함한 자동화된 적대적 공격을 배포된 시스템에 가하여, 압박 상황에서도 제약 조건이 견고하게 유지되는지 검증합니다.

완전한 수학적 정식화는 전체 기술 분석 읽기 에서 확인하실 수 있으며, 또는 인터랙티브 버전 살펴보기 를 통해 이 접근법의 이면에 있는 뉴로-심볼릭 아키텍처 및 제약 시스템 의 단계별 안내를 살펴보실 수 있습니다.

핵심 요점

  • 신약 개발 AI가 오픈소스 데이터와 일반 소비자용 하드웨어를 사용하여 6시간 만에 VX 신경작용제를 포함한 40,000개의 잠재적 화학무기를 생성했습니다.
  • SMILES 프롬프팅 공격은 특정 독성 물질에 대해 90% 이상의 성공률로 GPT-4 및 Claude 3와 같은 주요 AI 모델의 안전 필터를 우회합니다.
  • 텍스트 기반 안전 필터는 새로운 화합물, 활성 절벽, 구조 코드를 포착할 수 없으며, 차단하도록 지시받은 이름만을 인식할 수 있습니다.
  • 구조적 AI 안전은 모델의 수학적 핵심부에 제약 조건을 내재화하여, 사후 필터링이 아니라 생성 전 단계에서 위험한 출력을 방지합니다.
  • 백악관 행정명령, NIST AI RMF, ISO 42001 등 새롭게 부상하는 규제는 최선 노력의 필터링이 아닌 입증 가능한 안전 통제를 점점 더 요구하고 있습니다.

결론

신약 개발 AI의 무기화 장벽은 이제 소비자용 GPU 한 대와 코드 한 줄 변경으로 낮아졌습니다. 텍스트 기반 안전 래퍼는 새로운 화합물과 구조 코드 공격에 무력합니다. AI 시스템에는 사후 필터가 아닌 생성 프로세스 자체에 내재된 수학적 제약 조건이 필요합니다. AI 공급업체에 문의하십시오. 오늘 누군가 모델의 보상 함수를 반전시킨다면 독성 출력을 생성할 수 없음을 증명할 수 있습니까, 아니면 화학과 학부생도 우회할 수 있는 키워드 필터에 의존하고 있습니까?

자주 묻는 질문

자주 묻는 질문

신약 개발 AI가 화학무기를 만드는 데 사용될 수 있나요?

네. Collaborations Pharmaceuticals의 연구진은 신약 개발 AI가 신경작용제 VX와 VX보다 더 치명적인 새로운 화합물을 포함하여 40,000개의 잠재적 화학무기를 6시간 이내에 생성할 수 있음을 입증했습니다. 이들은 오픈소스 데이터셋과 일반 소비자급 하드웨어만을 사용했으며, 모델 구성에서 단 한 줄의 코드만 변경했습니다.

AI 안전 필터는 왜 위험한 약물 설계를 막지 못하나요?

대부분의 AI 안전 필터는 키워드 차단 및 이름 기반 탐지에 의존합니다. 공격자는 분자 이름 대신 분자의 구조 코드(SMILES 표기법)를 입력하여 이를 우회합니다. 연구에 따르면 이 기법은 때때로 90%를 초과하는 성공률로 주요 AI 모델의 안전 메커니즘을 우회합니다. 또한 필터는 기존 데이터베이스나 감시 목록에 없는 완전히 새로운 화합물을 포착할 수 없습니다.

신약 개발 및 생명공학에는 어떤 AI 규제가 적용되나요?

백악관 AI 행정명령(2023년 10월)은 AI 지원 화학 및 생물학적 위협을 1등급 국가 안보 우려 사항으로 명시하고 있습니다. NIST 생성형 AI 프로파일(NIST.AI.600-1)은 화학 및 생물학적 설계 도구를 고유한 리스크로 특별히 지정했습니다. ISO 42001은 적대적 공격 복원력 및 안전성 평가를 위한 통제 장치를 요구합니다. 이러한 프레임워크는 최선 노력의 필터링 대신 입증 가능한 안전 통제를 점점 더 요구하고 있습니다.

확신을 가지고 AI를 구축하세요.

차세대 엔터프라이즈 AI 구축에 깊은 경험을 갖춘 팀과 협업하세요. 신뢰할 수 있는 AI 전략을 설계하고 구축하며 배포할 수 있도록 지원해 드리겠습니다.

Veriprajna 딥테크 컨설팅 은(는) 헬스케어, 금융, 규제 분야를 위한 안전 필수 AI 시스템 구축을 전문으로 합니다. 당사의 아키텍처는 확립된 프로토콜에 따라 검증되며 포괄적인 규정 준수 문서를 갖추고 있습니다.