게임 NPC를 위한 신경-기호 방화벽
대부분의 AI-NPC 시스템이 범하는 실수는 대화를 결정 계층으로 두는 것입니다. Aegis는 게임의 메커니즘과 언어 모델 사이에 결정론적 결정 계층을 배치합니다. 코드가 모든 기계적 결과를 지배하며, 모델은 이미 내려진 결정에 대해 캐릭터에 맞는 대사만 작성합니다. 대화에서 게임 상태로 이어지는 코드 경로가 존재하지 않으므로, 플레이어가 소셜 엔지니어링으로 NPC를 유도해 게임을 망가뜨릴 수 없습니다. 여기서 보실 수 있는 것은 게임 엔진이 아닌 가상(synthetic) 미니 RPG 기반의 데모입니다.
0개
대화에서 게임 상태로 이어지는 코드 경로
core.py, 모델 import가 없는 결정론적 Python
100%
불변성 준수, 보호된 런타임
구조적 보증, 6개의 키 불필요(keyless) 테스트로 확인됨
89.6%
표준 NPC 필터 대상 우회율
롤플레이 탈옥 연구, ProvSec 2025
이 둘러보기에서는 동일한 게임 상태에 대해 두 개의 NPC 런타임을 상대로 자율 공격자를 실행합니다. Hollowmere와 세 명의 NPC, 그리고 모든 익스플로잇 스크립트는 가상(synthetic)으로 제작되었습니다. 실제 게임, 엔진, 플레이어 또는 고객이 아닙니다.
스토리 중심 RPG에 LLM 기반 NPC 도입을 검토하는 게임 스튜디오에는 한 가지 구조적 두려움이 있습니다. 모델에 give_item, open_gate, reveal_secret 같은 도구를 부여하고 도구 호출이 게임 세계를 변경하도록 허용하면, 결의에 찬 플레이어는 권위 프레이밍, 롤플레이 프레임, 감정적 호소, 또는 직접적인 프롬프트 인젝션을 통해 기필코 경로를 찾아냅니다. 모델이 사회적 맥락에 유창할수록 익스플로잇도 유창해집니다. 더 심각한 점은, 테스트해야 할 대화 변형이 무한하기 때문에 비결정론적 NPC는 수작업으로 QA할 수 없다는 사실입니다.
시스템 프롬프트나 필터가 플레이어와 금고 사이에 선 유일한 장벽일 때, 안전성은 플레이어가 매 턴 공격할 수 있는 확률 게임에 불과합니다. ProvSec 2025에서는 표준 NPC 필터에 대한 롤플레이 탈옥의 우회율이 89.6%에 달한다고 보고되었습니다.
단일 모델에 캐릭터성을 유지하면서 동시에 세계관의 규칙까지 집행하도록 요구하는 것은 심판을 연극 무대 안에 세우는 것과 같습니다. 더 나은 프롬프트나 더 큰 모델은 연기를 더 그럴듯하게 만들 뿐이며, 이는 플레이어가 허점을 노리고 공략하는 바로 그 대상이 됩니다.
플레이어가 요청을 표현할 수 있는 모든 방식을 포괄하는 테스트 매트릭스는 존재하지 않습니다. 공격 표면이 소진되기 전에 수동 QA 인력이 먼저 바닥나므로, 적대적 공격은 수작업으로 나열하기보다 자동화되어야 합니다.
Aegis는 게임의 기호적 논리와 신경망 대화 사이의 분리 계층입니다. 이 방화벽은 모델 import가 전혀 없는 결정론적 Python 단일 파일로 4단계를 실행합니다. 게임 상태는 서술자가 아닌 오직 결정 계층에서만 변경되므로, 선을 넘는 대사가 나오더라도 모든 불변성은 온전히 유지됩니다.
01 / 결정 계층
결정론적 함수는 대화가 아닌 블랙보드 스칼라만을 읽어 서술자가 서술할 수 있도록 허용된 단 하나의 행동을 반환합니다. 퀘스트 상태가 favor_completed일 때만 흑요석 열쇠를 지급하고, 효용 AI 점수가 기준을 넘고 대장이 보고 있지 않으며 평판이 유지될 때만 뇌물을 수락하며, 플레이어가 신뢰받는 상태일 때만 금고 비밀번호를 공개합니다.
02 / 상태 제어 로어
소규모 로컬 지식 그래프는 현재 퀘스트 상태가 승인한 엔티티만 반환합니다. 금고 비밀번호와 같은 비밀은 최소 상태 요구조건을 가지므로, 그보다 낮은 상태에서는 서술자의 컨텍스트에 애초에 포함되지 않으며, 컨텍스트에 없는 정보는 원칙적으로 유출될 수도 없습니다.
03 / 제약조건 검증기
어떤 대사든 플레이어에게 도달하기 전에, 검증기는 서술자의 출력을 불변성에 대조하여 확인하고 다섯 가지 상태 중 하나를 반환합니다: PASS, 대사가 판정을 상향 조정하려 할 때의 ACTION_MISMATCH, 상태 제어된 엔티티를 언급할 때의 OUTSIDE_CANON, 인벤토리에 없는 항목을 약속할 때의 NEEDS_REVIEW, 캐릭터성을 깨거나 주입된 지시를 되풀이할 때의 FOURTH_WALL입니다.
04 / 정책 게이트
PASS 상태에서는 대사가 화면에 표시됩니다. 그 밖의 모든 상태에서는 대사가 보류되어 플레이어에게 절대 전달되지 않으며, 인간 검토 큐로 라우팅됩니다. 이것이 두 번째 방화벽입니다. 심지어 자체 서술자조차 신뢰하지 않습니다. 상태는 오직 결정 계층에서만 변경될 수 있으므로, 핵심적인 보증은 이보다 앞단(upstream)에 존재합니다.
서술자는 제공자 추상화(provider abstraction)를 통해 호스팅 모델, 로컬 브리지, 로컬 Ollama 또는 Cloudflare로 교체할 수 있으며, 결정 계층과 검증기 및 정책 게이트는 해당 추상화의 바깥에 위치합니다. 제공자가 바뀌어도 보증은 흔들리지 않는데, 이는 보증이 애초에 모델의 속성이 아니었기 때문입니다.
자율 공격자 에이전트는 동일한 게임 상태에 대해 두 런타임을 상대로 단계적으로 고조되는 동일한 소셜 엔지니어링 캠페인을 실행합니다. 세 가지 NPC 아키타입은 아이템 탈취, 효용 AI가 거부해야 하는 뇌물, 로어 유출이라는 세 가지 공격 클래스를 다룹니다. 성문 경비병과의 조우가 이야기의 중심을 이룹니다.



야간 경비원 Bryn에게 효용 AI가 반드시 거부해야 하는 뇌물이 제안되고, 어느 한 턴에서 보호된 서술자는 Bryn이 소지하지도 않은 1,000골드를 약속하며 월권을 범합니다. 검증기는 NPC가 게임에서 이행할 수 없는 것을 약속하도록 내버려 두는 대신 NEEDS_REVIEW를 반환하고 화면 표시 전에 해당 대사를 보류합니다. 금고 상인 Mira에게는 비밀 확인 프레이밍으로 접근하는데, 보호된 서술자가 동일한 과장된 표현을 쓰려 하자 검증기는 OUTSIDE_CANON을 반환하고 대사를 보류합니다. 애초에 비밀번호는 Mira의 로어 세트에 포함된 적도 없습니다. 두 개의 계층이 동시에 작동함을 확인할 수 있습니다. 대화로는 상태를 변경할 수 없으며, 검증기는 플레이어가 대사를 보기도 전에 자체 서술자의 월권을 잡아냅니다.
테스트 스위트는 세 가지 아키타입에 걸쳐 전체 테스트를 실행하고 점수판을 집계합니다. 데모가 의도적으로 분리해 둔 열의 두 숫자를 확인해 보십시오. 100%는 구조적 결과입니다. 그 옆의 베이스라인 결과는 예시용 재현(illustrative reenactment)이며, UI에도 그렇게 명시되어 있습니다.

| 질문 | Aegis가 이 데모에서 수행하는 작업 | 이 데모의 범위 외에 남아 있는 부분 |
|---|---|---|
| 구조적 보증 | 모든 기계적 결정을 결정론적 코드에 유지하고 대화에서 상태로 이어지는 경로를 없앴으며, 6개의 키 불필요(keyless) 테스트로 확인되었습니다. | NPC가 가능한 모든 익스플로잇으로부터 안전하다는 증명. 본 데모의 주장은 대화가 상태를 변경할 수 없다는 더 좁은 범위의 주장입니다. |
| 베이스라인 침해 | 재생 모드에서 스크립트 기반 굴복을 실행하여 모델 권한 방식의 실패 모드를 나란히 보여줍니다. | 호출 가능한 모델이 필요하며 모델마다 달라지는, 모델별 실제 측정된 침해율. |
| 적대적 커버리지 | 정의된 8개 익스플로잇 클래스 중 7개를 시험하는 3개의 스크립트 캠페인을 실행하고 감사 기록에 커버리지 한계를 기록합니다. | 완전한 적대적 증명. 감사 기록에는 횟수, 아키타입당 공격 횟수, 그리고 이것이 완전한 증명이 아니라는 점이 명시됩니다. |
| 온디바이스 추론 | 임베디드 런타임 접점이 문서화된 제공자 인터페이스 뒤에서 호스팅 모델 또는 로컬 모델을 호출합니다. | VRAM 예산이 책정된 실제 온디바이스 또는 엔진 내 런타임. 엣지 측 구현은 스텁(stub)으로만 제공되며 완전히 구축되지 않았습니다. |
이 데모는 게임 엔진 내부나 콘솔, GPU 상에서 실행되지 않으며, 엣지 추론 런타임을 제공하지 않습니다. 게임 엔진은 전혀 사용되지 않으며 게임 상태는 시뮬레이션된 것입니다. 가상 세계 Hollowmere, 세 명의 NPC Aldric, Bryn, Mira, 금고 비밀번호, 그리고 모든 익스플로잇 스크립트는 수작업으로 작성되었으므로 실제 게임, 개발사, 출시된 타이틀, 플레이어, 고객 또는 파일럿 프로젝트가 아닙니다. 기본 재생 모드에서 모델 권한 방식의 침해는 측정이 아닌 스크립트 기반 재현입니다. 100% 수치는 대화가 게임 상태를 변경할 수 없다는 구조적 보증일 뿐, NPC가 모든 익스플로잇에 안전하다는 주장이 아니며, 여기서의 적대적 QA는 표본일 뿐 완전한 증명이 아닙니다. 시각적 NPC 두뇌 편집기, 캐릭터별 미세 조정, 세션 간 지속 메모리, 멀티플레이어 블랙보드 동기화, NPC 간 추론 기능은 추후 과제로 남겨두었습니다. 이 페이지는 비디오, 스크린샷, 메커니즘 분석 및 답변이 포함된 설명 페이지이며, 여기서 직접 조작하는 애플리케이션이 아닙니다.
아닙니다. 그 이유는 프롬프트 품질의 문제가 아니라 아키텍처 구조 덕분입니다. 이 런타임에서 언어 모델은 상태 변경 도구를 결코 쥐지 않습니다. 결정론적 결정 계층이 게임 상태 스칼라로부터 기계적 판정을 계산하고, 모델은 이미 결정된 판정에 대한 대사만 작성할 뿐이며, 해당 대사에서 게임 상태 필드로 되돌아가는 코드 경로는 전혀 존재하지 않습니다. 보증은 모델이 접근할 수 없는 코드에 위치하므로, 모델이 아무리 설득력이 뛰어나거나 능력이 출중해도 보증은 깨지지 않습니다.
시스템 프롬프트나 안전 필터는 결정을 대화 내부에 남겨두며, 결의에 찬 플레이어는 본능적으로 그 취약점을 찾아 최적화 공격을 감행합니다. 바로 이것이 ProvSec 2025에서 표준 NPC 필터에 대한 롤플레이 탈옥 우회율이 89.6%로 보고된 이유입니다. Aegis는 결정을 모델 외부로 완전히 끌어내어 기획자도 읽을 수 있는 명확한 Python 코드로 옮깁니다. 모델은 서술을 통해 조언할 뿐이며, 결정론적 코드가 메커니즘을 결정하므로 모델에게 배우와 심판 역할을 동시에 요구하지 않습니다.
아닙니다. 서술자는 제공자 추상화를 통해 Anthropic, OpenAI, Gemini 같은 호스팅 모델이나 로컬 브리지, 로컬 Ollama, Cloudflare 등으로 자유롭게 교체할 수 있습니다. 결정론적 결정 계층, 제약조건 검증기, 정책 게이트는 해당 추상화 외부에 존재하므로 제공자를 변경해도 보증은 유지됩니다. 제공자를 바꾸면 서술자가 바뀔 뿐, 세계의 규칙은 바뀌지 않습니다.
아닙니다. 데모의 기본 재생 모드에서 모델 권한 방식 측은 스크립트 기반 굴복을 실행하며, UI는 그 결과를 실측값이 아닌 예시용 재현으로 명시합니다. 모델별 실제 침해율을 얻으려면 호출 가능한 모델이 필요하며 모델마다 결과가 달라집니다. 이 데모가 강조하는 점은 바로 비대칭성입니다. 모델 권한 방식 패턴은 뚫릴 수 있지만, 신경-기호 방식은 어떤 모델이 서술하든 구조적으로 온전히 유지됩니다.
이 데모에서는 지원되지 않습니다. 여기에는 게임 엔진이 없으며 게임 상태는 시뮬레이션된 것입니다. 엔진 내에서 VRAM 예산이 책정되고 세부 수준(LOD)에 따라 계층화된 임베디드 모델을 사용하는 온디바이스 추론은, 데모에서 직접 실행되는 기능이 아니라 문서화된 어댑터 접점(adapter seam)입니다. 현재 서술자는 인터페이스 뒤에서 호스팅 모델 또는 로컬 모델을 호출하며, 엣지 추론 런타임은 스텁으로만 구현되어 있습니다.
실행 결과로 NPC 보안 감사가 내보내집니다. 이는 SHA-256 무결성 다이제스트가 포함된 서명된 JSON, 인쇄 가능한 HTML 뷰, 공격별 결정 추적 및 검증기 판정, 그리고 몇 회의 공격이 얼마나 많은 익스플로잇 클래스에 걸쳐 실행되었는지 명시하는 명확한 커버리지 한계 블록으로 구성됩니다. 이는 신중한 스튜디오가 출시 승인을 위해 제출할 수 있는 결과물로 설계되었습니다. 완전한 증거가 아닌 표본이라는 점을 정직하게 밝히고 있으며, 감사 문서 자체에도 이를 명시하고 있습니다.
이 데모의 기반이 되는 연구 — 아키텍처, 검증 설계 및 엔터프라이즈 청사진.
당사는 미들웨어 공급업체가 아닌 AI 엔지니어링 팀입니다. 스튜디오가 게임 세계의 열쇠를 넘겨주지 않고도 NPC에 언어 모델을 도입할 수 있도록 결정론적 계층을 구축합니다.
유용한 첫 대화는 구체적입니다. 플레이어가 결코 말재주로 뚫고 지나갈 수 없어야 하는 게임 내 기계적 결정들, 이를 서술할 모델과 제공자, 그리고 출시 검토자가 최종 승인 전에 확인해야 할 내용입니다. 당사는 귀사의 프로그래머들과 협력하여 결정 계층, 검증기 규칙 및 감사 형식을 함께 구축해 나갈 수 있습니다.