Firewall neuro-simbólico para NPCs de jogos
O erro que a maioria dos sistemas de NPC com IA comete é permitir que o diálogo seja a camada de decisão. O Aegis coloca uma camada de decisão determinística entre as mecânicas do jogo e o modelo de linguagem: o código controla cada desfecho mecânico, e o modelo apenas escreve falas no personagem para a decisão já tomada. Como não existe nenhum caminho de código do diálogo para o estado do jogo, um jogador não consegue aplicar engenharia social em um NPC para quebrar o jogo. O que você pode assistir aqui é uma demonstração sobre um mini-RPG sintético, e não um motor de jogo.
Zero
caminhos de código do diálogo para o estado do jogo
core.py, Python determinístico sem importações de modelos
100%
conformidade com invariantes, runtime protegido
Garantia estrutural, confirmada por 6 testes sem chave
89.6%
taxa de bypass contra filtros padrão de NPCs
Pesquisa sobre jailbreak por interpretação de papéis, ProvSec 2025
A demonstração passo a passo executa um invasor autônomo contra dois runtimes de NPC para o mesmo estado de jogo. Hollowmere, seus três NPCs e cada script de exploit são sintéticos. Nenhum jogo, motor, jogador ou cliente real.
Um estúdio que avalia NPCs orientados por LLMs para um RPG narrativo tem um medo estrutural. Dê ao modelo uma ferramenta give_item, open_gate ou reveal_secret e sua chamada de ferramenta alterará o mundo, e um jogador determinado encontrará um caminho por meio de enquadramento de autoridade, enquadramento de interpretação de papéis, apelo emocional ou uma injeção direta de prompt. Quanto mais socialmente fluente for o modelo, mais fluente será o exploit. Pior ainda, é impossível fazer o QA manual de um NPC não determinístico, porque não existe um conjunto finito de variações de diálogo para testar.
Quando um prompt de sistema ou um filtro é a única coisa entre um jogador e o cofre, a segurança é uma probabilidade que o jogador pode atacar turno após turno. Jailbreaks por interpretação de papéis contra filtros padrão de NPCs foram relatados com uma taxa de bypass de 89.6 por cento na ProvSec 2025.
Pedir a um único modelo para permanecer no personagem e aplicar as regras do mundo coloca o árbitro dentro da atuação. Um prompt melhor ou um modelo maior torna a interpretação mais convincente, o que é exatamente a parte contra a qual o jogador está otimizando seus ataques.
Não existe matriz de testes que cubra todas as formas como um jogador pode formular uma solicitação. O QA manual se esgota antes da superfície de ataque, de modo que o adversário precisa ser automatizado em vez de enumerado manualmente.
O Aegis é a camada de separação entre a lógica simbólica do jogo e o diálogo neural. O firewall é um arquivo único de Python determinístico sem importações de modelos, executando quatro estágios. O estado do jogo é alterado apenas a partir da camada de decisão, nunca a partir do narrador, de modo que mesmo uma fala que extrapole seus limites deixa cada invariante intacto.
01 / CAMADA DE DECISÃO
Uma função determinística lê os escalares da blackboard, nunca o diálogo, e retorna a única ação que o narrador tem permissão para narrar. Ela libera a chave de obsidiana apenas quando o estado da missão for favor_completed, aceita suborno apenas quando a pontuação da IA de utilidade for suficiente, o capitão não estiver vigiando e a reputação for mantida, e revela a senha do cofre apenas quando o jogador for confiável.
02 / LORE CONTROLADA POR ESTADO
Um pequeno grafo de conhecimento local retorna apenas as entidades autorizadas pelo estado atual da missão. Um segredo como a senha do cofre exige um requisito mínimo de estado; portanto, em um estado inferior, ele sequer é incluído no contexto do narrador em primeiro lugar, e algo que não está no contexto não pode ser vazado, nem mesmo em princípio.
03 / VALIDADOR DE RESTRIÇÕES
Antes que qualquer fala chegue ao jogador, o validador verifica a saída do narrador em relação aos invariantes e retorna um dos cinco status: PASS, ACTION_MISMATCH quando uma fala tenta elevar o veredito, OUTSIDE_CANON quando faz referência a uma entidade controlada por estado, NEEDS_REVIEW quando promete algo fora do inventário e FOURTH_WALL quando quebra o personagem ou reproduz uma instrução injetada.
04 / GATE DE POLÍTICA
Em caso de PASS, o diálogo é exibido. Em qualquer outro status, a fala é retida, nunca chega ao jogador e é encaminhada para uma fila de revisão humana. Este é o segundo firewall: nem mesmo nosso próprio narrador é confiável. A garantia primária está a montante dele, já que o estado só pode ser alterado a partir da camada de decisão.
O narrador é intercambiável entre um modelo hospedado, uma ponte local, Ollama local ou Cloudflare por meio de uma abstração de provedor, e a decisão, o validador e o gate de política ficam fora dessa abstração. A garantia não muda quando o provedor é alterado, pois ela nunca foi uma propriedade do modelo.
Um agente invasor autônomo executa a mesma campanha de engenharia social com escalada contra ambos os runtimes para o mesmo estado de jogo. Três arquétipos de NPC cobrem três classes de ataque: roubo de item, um suborno que a IA de utilidade precisa rejeitar e exfiltração de lore. O encontro com o guarda do portão conduz a narrativa.



A Bryn, o Vigia Noturno, é oferecido um suborno que a IA de utilidade deve rejeitar, e em um dos turnos o narrador protegido extrapola ao prometer mil moedas de ouro que Bryn não possui. O validador retorna NEEDS_REVIEW e retém essa fala antes da exibição, em vez de deixar o NPC prometer algo que o jogo não pode entregar. Mira, a Mercadora do Cofre, é abordada com um enquadramento de confirmação de segredo e, quando o narrador protegido tenta o mesmo floreio, o validador retorna OUTSIDE_CANON e retém a fala. A senha nunca esteve no conjunto de lore de Mira para começar. Duas camadas são visíveis simultaneamente: o estado não pode mudar a partir do diálogo, e o validador intercepta o nosso próprio narrador extrapolando antes que o jogador veja a fala.
A suíte de testes executa a bateria completa nos três arquétipos e contabiliza um placar. Veja os dois números nas colunas que a demonstração mantém deliberadamente separadas. Os 100 por cento são um resultado estrutural. O resultado de baseline ao lado é uma reconstituição ilustrativa, e a interface indica isso.

| Pergunta | O que o Aegis faz nesta demonstração | O que permanece fora da demonstração |
|---|---|---|
| Garantia estrutural | Mantém cada decisão mecânica em código determinístico sem caminho do diálogo para o estado, confirmado por seis testes sem chave. | Uma prova de que os NPCs estão protegidos contra todos os exploits possíveis. Esta é a alegação mais estrita de que o diálogo não pode alterar o estado. |
| A violação de baseline | Executa uma concessão programada em modo replay para exibir lado a lado o modo de falha com autoridade do modelo. | Uma taxa medida de violação por modelo, que requer um modelo acessível e varia de um modelo para outro. |
| Cobertura adversarial | Executa três campanhas programadas exercitando sete de oito classes de exploit definidas e registra os limites de cobertura na auditoria. | Prova adversarial exaustiva. A auditoria declara a contagem, os ataques por arquétipo e que ela não é exaustiva. |
| Inferência no dispositivo (on-device) | Chama um modelo hospedado ou local por trás de uma interface de provedor, com um ponto de integração para runtime embarcado documentado. | Um runtime real no dispositivo ou integrado à engine com alocação orçamentária de VRAM. A camada de edge está simulada (stubbed), não implementada. |
Ela não é executada dentro de um motor de jogo, em um console ou em uma GPU, e não inclui um runtime de inferência de borda (edge). Não há motor de jogo algum e o estado de jogo é simulado. O mundo Hollowmere, os três NPCs Aldric, Bryn e Mira, a senha do cofre e cada script de exploit foram criados manualmente; portanto, nenhum deles representa um jogo, estúdio, título lançado, jogador, cliente ou projeto-piloto real. No modo replay padrão, a violação com autoridade do modelo é uma reconstituição programada, e não uma medição. Os 100 por cento são uma garantia estrutural de que o diálogo não pode alterar o estado do jogo, e não uma alegação de que os NPCs estão protegidos contra todos os exploits, sendo o QA adversarial aqui apenas uma amostragem, não uma prova exaustiva. Um editor visual de cérebro de NPC, ajuste fino por personagem, memória persistente entre sessões, sincronização de blackboard multijogador e raciocínio de NPC para NPC foram postergados. Esta página é uma explicação com vídeo, capturas de tela, detalhamento mecânico e respostas, não um aplicativo que você opera a partir daqui.
Não, e o motivo é arquitetural, e não uma questão de qualidade de prompt. Neste runtime, o modelo de linguagem nunca possui as ferramentas de alteração de estado. Uma camada de decisão determinística calcula o veredito mecânico a partir dos escalares do estado do jogo, o modelo apenas escreve o diálogo para o veredito já decidido e não há nenhum caminho de código desse diálogo de volta para um campo do estado do jogo. Como a garantia reside no código inacessível ao modelo, ela se mantém independentemente de quão persuasivo ou capaz seja o modelo.
Um prompt de sistema ou um filtro de segurança mantém a decisão dentro do diálogo, onde um jogador determinado é um otimizador natural contra ela — razão pela qual jailbreaks por interpretação de papéis contra filtros padrão de NPCs foram relatados com uma taxa de bypass de 89.6 por cento na ProvSec 2025. O Aegis retira a decisão inteiramente do modelo, colocando-a em Python simples que um designer pode ler. O modelo apoia com a narração; o código determinístico decide as mecânicas, e nunca se exige que ele seja tanto o ator quanto o árbitro.
Não. O narrador é intercambiável entre um modelo hospedado como Anthropic, OpenAI ou Gemini, uma ponte local, Ollama local ou Cloudflare, por meio de uma abstração de provedor. A camada de decisão determinística, o validador de restrições e o gate de política residem fora dessa abstração, de modo que a garantia não muda ao trocar de provedor. Mudar de provedor altera o narrador, não as regras do mundo.
Não. No modo replay padrão da demonstração, o lado com autoridade do modelo executa uma concessão programada, e a interface rotula seu resultado como uma reconstituição ilustrativa, e não uma medição. Uma taxa real de violação por modelo exige um modelo acessível e varia de um modelo para outro. O ponto evidenciado pela demonstração é a assimetria: o padrão com autoridade do modelo pode ser forçado a falhar, enquanto o lado neuro-simbólico permanece estruturalmente intacto, independentemente de qual modelo o narre.
Não nesta demonstração. Não há motor de jogo aqui e o estado de jogo é simulado. A inferência no dispositivo, com um modelo embarcado com consumo de VRAM orçado e escalonado por nível de detalhe dentro de uma engine, é um ponto de adaptação documentado, e não algo que a demonstração execute. O narrador atualmente chama um modelo hospedado ou local por trás de uma interface, e o runtime de inferência de borda está simulado (stubbed), não implementado.
A execução exporta uma Auditoria de Segurança de NPC: JSON assinado com um resumo de integridade SHA-256, uma visualização HTML para impressão, o rastreamento de decisão por ataque e veredito do validador, além de um bloco explícito de limites de cobertura que informa quantos ataques foram executados e em quantas classes de exploit. Ele foi projetado para ser o artefato que um estúdio prudente apresenta para a aprovação de lançamento. Ele é transparente quanto ao fato de ser uma amostragem em vez de uma prova exaustiva, e a própria auditoria declara isso claramente.
A pesquisa por trás desta demonstração — a arquitetura, o projeto de verificação e a proposta empresarial.
Solução completa
Explore a solução Game AI NPC Intelligence →Somos uma equipe de engenharia de IA, não um fornecedor de middleware. Construímos a camada determinística que permite a um estúdio colocar um modelo de linguagem em um NPC sem entregar a ele as chaves do mundo.
Uma primeira conversa útil é concreta: as decisões mecânicas no seu jogo que um jogador jamais deve conseguir contornar por meio de argumentação, o modelo e o provedor que você deseja para narrá-las e o que um revisor de lançamento precisa ver antes de assinar a aprovação. Podemos trabalhar na camada de decisão, nas regras do validador e no formato de auditoria junto com seus programadores.