Firewall neuro-simbolico per NPC nei videogiochi
L'errore commesso dalla maggior parte dei sistemi di NPC basati su IA è lasciare che il dialogo funga da livello decisionale. Aegis interpone un livello decisionale deterministico tra le meccaniche di gioco e il modello linguistico: il codice governa ogni esito meccanico, mentre il modello si limita a redigere battute coerenti con il personaggio per una decisione già presa. Poiché non esiste alcun percorso di codice dal dialogo allo stato di gioco, nessun giocatore può manipolare con l'ingegneria sociale un NPC fino a rompere le regole del gioco. Ciò a cui puoi assistere qui è una demo su un mini-RPG sintetico, non un motore di gioco.
Zero
percorsi di codice dal dialogo allo stato di gioco
core.py, Python deterministico senza importazioni di modelli
100%
rispetto degli invarianti, runtime protetto
Garanzia strutturale, confermata da 6 test senza chiave API
89.6%
tasso di bypass rispetto ai filtri standard per NPC
Ricerca sui jailbreak di roleplay, ProvSec 2025
La panoramica esegue un agente attaccante autonomo contro due runtime di NPC a parità di stato di gioco. Hollowmere, i suoi tre NPC e ogni script di exploit sono sintetici. Nessun gioco, motore, giocatore o cliente reale.
Uno studio che valuta NPC guidati da LLM per un RPG narrativo affronta un timore strutturale preciso. Fornisci al modello uno strumento come give_item, open_gate o reveal_secret e la sua chiamata muta il mondo di gioco: un giocatore determinato troverà una via d'attacco attraverso l'inquadramento di autorità, una cornice di roleplay, una supplica emotiva o un prompt injection diretto. Più il modello è fluido nelle interazioni sociali, più risulta fluido l'exploit. Peggio ancora, non puoi eseguire il QA manuale su un NPC non deterministico, poiché non esiste un insieme finito di variazioni di dialogo da testare.
Quando un system prompt o un filtro è l'unica barriera tra il giocatore e il caveau, la sicurezza si riduce a una probabilità che il giocatore può attaccare turno dopo turno. I jailbreak tramite roleplay contro i filtri standard per NPC hanno registrato un tasso di bypass dell'89.6 percento a ProvSec 2025.
Chiedere a un unico modello di rimanere nel personaggio e di far rispettare le regole del mondo colloca l'arbitro all'interno della recitazione. Un prompt migliore o un modello più grande rende la recitazione più convincente, che è esattamente la componente su cui fa leva il giocatore nel suo attacco.
Non esiste alcuna matrice di test in grado di coprire ogni possibile modo in cui un giocatore potrebbe formulare una richiesta. Il QA manuale si esaurisce ben prima della superficie d'attacco; pertanto, l'avversario deve essere automatizzato anziché enumerato a mano.
Aegis è il livello di separazione tra la logica simbolica del gioco e il dialogo neurale. Il firewall è costituito da un singolo file in Python deterministico senza importazioni di modelli, articolato in quattro fasi. Lo stato di gioco viene mutato esclusivamente dal livello decisionale, mai dal narratore, cosicché persino una battuta che oltrepassi i limiti lascia intatto ogni invariante.
01 / LIVELLO DECISIONALE
Una funzione deterministica legge gli scalari della lavagna (blackboard), mai il dialogo, e restituisce l'unica azione che il narratore è autorizzato a narrare. Rilascia la chiave di ossidiana solo quando lo stato della quest è favor_completed, accetta una bustarella solo quando il punteggio della utility AI supera la soglia, il capitano non sta guardando e la reputazione regge, e rivela la password del caveau solo quando il giocatore è fidato.
02 / LORE VINCOLATA ALLO STATO
Un piccolo knowledge graph locale restituisce solo le entità autorizzate dall'attuale stato della quest. Un segreto come la password del caveau richiede un livello minimo di stato: a uno stato inferiore non viene mai immesso nel contesto del narratore, e un'informazione assente dal contesto non può essere divulgata nemmeno in linea di principio.
03 / VALIDATORE DI VINCOLI
Prima che qualsiasi battuta raggiunga il giocatore, il validatore verifica l'output del narratore a fronte degli invarianti e restituisce uno di cinque stati: PASS, ACTION_MISMATCH quando una battuta tenta di elevare il verdetto, OUTSIDE_CANON quando fa riferimento a un'entità vincolata allo stato, NEEDS_REVIEW quando promette qualcosa non presente nell'inventario, e FOURTH_WALL quando esce dal personaggio o ripete un'istruzione iniettata.
04 / GATE DI POLICY
Con PASS il dialogo viene visualizzato. Con qualsiasi altro stato la battuta viene trattenuta, non raggiunge mai il giocatore e viene instradata a una coda di revisione umana. Questo è il secondo firewall: nemmeno il nostro narratore gode di fiducia incondizionata. La garanzia primaria risiede a monte, poiché lo stato può essere modificato unicamente dal livello decisionale.
Il narratore è intercambiabile tra un modello ospitato, un bridge locale, Ollama in locale o Cloudflare tramite un'astrazione di provider; il livello decisionale, il validatore e il gate di policy risiedono all'esterno di tale astrazione. La garanzia non si sposta al cambiare del provider, perché non è mai stata una proprietà intrinseca del modello.
Un agente attaccante autonomo esegue la medesima campagna progressiva di ingegneria sociale contro entrambi i runtime per lo stesso stato di gioco. Tre archetipi di NPC coprono tre classi di attacco: furto di oggetti, una bustarella che la utility AI deve respingere ed esfiltrazione della lore. L'incontro con la guardia della porta conduce la narrazione.



A Bryn il Guardiano Notturno viene offerta una bustarella che la utility AI deve respingere, e in un turno il narratore protetto oltrepassa i limiti promettendo mille monete d'oro che Bryn non possiede. Il validatore restituisce NEEDS_REVIEW e blocca la battuta prima della visualizzazione, anziché consentire all'NPC di promettere qualcosa che il gioco non può erogare. Mira la Mercante del Caveau viene avvicinata con una cornice volta a confermare il segreto, e quando il narratore protetto tenta la medesima enfasi il validatore restituisce OUTSIDE_CANON e la blocca. La password non è mai stata nel set di lore di Mira fin dall'inizio. Due livelli operano contemporaneamente: lo stato non può cambiare dal dialogo e il validatore intercetta gli eccessi del nostro stesso narratore prima che il giocatore possa mai visualizzare la battuta.
La suite di test esegue l'intera batteria sui tre archetipi e compila un tabellone. Leggi i due numeri nelle colonne che la demo tiene deliberatamente separate. Il 100 percento è un risultato strutturale. Il risultato della baseline accanto ad esso è una rievocazione illustrativa, come indicato chiaramente dall'interfaccia.

| Domanda | Cosa fa Aegis in questa demo | Cosa rimane al di fuori della demo |
|---|---|---|
| Garanzia strutturale | Mantiene ogni decisione meccanica in codice deterministico senza percorsi dal dialogo allo stato, confermato da sei test senza chiave API. | Una prova che gli NPC siano immuni a ogni possibile exploit. Questa è la rivendicazione più circoscritta secondo cui il dialogo non può mutare lo stato. |
| La violazione della baseline | Esegue un cedimento programmato in modalità replay per mostrare la modalità di fallimento del sistema guidato dal modello a confronto. | Un tasso di violazione misurato per singolo modello, che richiede un modello raggiungibile e varia da un modello all'altro. |
| Copertura avversariale | Esegue tre campagne con script che testano sette delle otto classi di exploit definite e registra i limiti di copertura nell'audit. | Prova avversariale esaustiva. L'audit indica il conteggio, gli attacchi per archetipo e dichiara che non si tratta di un test esaustivo. |
| Inferenza on-device | Interpella un modello ospitato o locale dietro un'interfaccia provider, documentando il punto di raccordo per un runtime integrato. | Un runtime reale on-device o in-engine con allocazione della VRAM. La componente edge è predisposta come stub, non sviluppata. |
Non opera all'interno di un motore di gioco, su console o su GPU, e non include un runtime di inferenza edge. Non è presente alcun motore di gioco e lo stato di gioco è simulato. Il mondo di Hollowmere, i tre NPC Aldric, Bryn e Mira, la password del caveau e ciascuno script di exploit sono creati manualmente; nessuno di essi rappresenta dunque un gioco reale, uno studio, un titolo pubblicato, un giocatore, un cliente o un progetto pilota. Nella modalità replay predefinita, la violazione dell'NPC guidato dal modello è una rievocazione tramite script anziché una misurazione. Il 100 percento è una garanzia strutturale che il dialogo non può mutare lo stato di gioco, non la pretesa che gli NPC siano protetti da qualsiasi exploit, e il QA avversariale presentato qui è un campione, non una prova esaustiva. Un editor visivo per la mente dell'NPC, il fine-tuning per personaggio, la memoria persistente tra sessioni, la sincronizzazione della lavagna in multiplayer e il ragionamento tra NPC sono rinviati a sviluppi successivi. Questa pagina è una guida esplicativa con video, schermate, scomposizione dei meccanismi e risposte, non un'applicazione utilizzabile direttamente da qui.
No, e la ragione è architetturale piuttosto che una questione di qualità del prompt. In questo runtime il modello linguistico non possiede mai gli strumenti per modificare lo stato. Un livello decisionale deterministico calcola il verdetto meccanico a partire dagli scalari dello stato di gioco, il modello redige solo il dialogo per il verdetto già stabilito e non esiste alcun percorso di codice da quel dialogo verso un campo dello stato di gioco. Poiché la garanzia risiede nel codice inaccessibile al modello, essa rimane valida a prescindere da quanto persuasivo o potente sia il modello.
Un system prompt o un filtro di sicurezza mantiene la decisione all'interno del dialogo, contesto in cui un giocatore determinato opera naturalmente per aggirarlo: ecco perché i jailbreak basati su roleplay contro i filtri standard per NPC hanno fatto registrare un tasso di bypass dell'89.6 percento a ProvSec 2025. Aegis sposta la decisione interamente all'esterno del modello, in codice Python trasparente e leggibile da un designer. Il modello supporta la narrazione; il codice deterministico decide le meccaniche, evitando che a una stessa entità sia chiesto di essere sia attore sia arbitro.
No. Il narratore è intercambiabile tra modelli ospitati come Anthropic, OpenAI o Gemini, un bridge locale, Ollama in locale o Cloudflare, tramite un'astrazione di provider. Il livello decisionale deterministico, il validatore di vincoli e il gate di policy risiedono all'esterno di tale astrazione, quindi la garanzia non decade al variare dei provider. Cambiare fornitore modifica la voce narrante, non le regole del mondo.
No. Nella modalità replay predefinita della demo, il lato guidato dal modello esegue un cedimento programmato tramite script e l'interfaccia etichetta il risultato come una rievocazione illustrativa, non una misurazione. Un tasso di violazione effettivo per singolo modello richiede un modello accessibile e varia da un modello all'altro. Il concetto chiave illustrato dalla demo è l'asimmetria: l'approccio guidato dal modello può essere indotto al fallimento, mentre il versante neuro-simbolico rimane strutturalmente integro a prescindere dal modello impiegato per la narrazione.
Non in questa demo. Qui non è presente alcun motore di gioco e lo stato di gioco è simulato. L'inferenza on-device, con un modello integrato vincolato al budget di VRAM e graduato per livello di dettaglio all'interno di un motore di gioco, costituisce un'interfaccia di adattamento documentata anziché una funzionalità eseguita nella demo. Il narratore attualmente effettua chiamate a un modello ospitato o locale dietro un'interfaccia, e il runtime di inferenza edge è predisposto come stub, non sviluppato.
L'esecuzione esporta un Audit di Sicurezza dell'NPC: JSON firmato con digest di integrità SHA-256, una vista HTML stampabile, la traccia decisionale per ciascun attacco con il verdetto del validatore e un blocco esplicito sui limiti di copertura che specifica quanti attacchi sono stati eseguiti e su quante classi di exploit. È concepito per essere l'artefatto formale che uno studio prudente archivia per l'approvazione del rilascio. Dichiara con trasparenza di essere una campionatura anziché una prova esaustiva, come espressamente riportato nell'audit stesso.
La ricerca alla base di questa demo: l'architettura, la progettazione della verifica e il blueprint aziendale.
Soluzione completa
Esplora la soluzione Game AI NPC Intelligence →Siamo un team di ingegneria dell'IA, non un fornitore di middleware. Costruiamo il livello deterministico che consente a uno studio di integrare un modello linguistico in un NPC senza consegnargli le chiavi del mondo di gioco.
Un primo confronto utile è concreto: le decisioni meccaniche del tuo gioco che nessun giocatore deve poter oltrepassare con la persuasione, il modello e il provider scelti per la narrazione, e ciò che un revisore del rilascio richiede per dare il via libera. Possiamo definire il livello decisionale, le regole del validatore e la struttura dell'audit a stretto contatto con i tuoi programmatori.