Crucible Model Vetting Firewall dashboard met kandidaatevaluatie en uitkomsten voor allow, review en quarantine.
Kunstmatige intelligentieCybersecuritySoftware engineering

Modeltoelating heeft een onopgeloste status nodig

Ashutosh SinghalAshutosh Singhal9 augustus 20267 min

Een beslissing over toelating van een AI-model moet aangeven welk bewijs toestaat dat het artefact verdergaat. Wanneer een lading geen geblokkeerde gebeurtenis oplevert maar statische inspectie nog steeds een gevaarlijk globaal element identificeert, comprimeert een goedkeuring twee verschillende bevindingen in één geruststellend antwoord. Ik wil dat de onopgeloste bevinding de beslissing overleeft, met een duidelijke weergave van wat nog moet worden vastgesteld.

We hebben Crucible, onze lokale Model Vetting Firewall-demo, rond dit onderscheid gebouwd. Deze maakt gebruik van synthetische artefacten, waaronder een bestand dat een handtekeningscanner niet markeert maar waarvan de lading een databasebewerking probeert, en een ander met een voorwaardelijke vertakking die ongebruikt blijft. Het eerste toont aan waarom een waargenomen poging ertoe doet. Het tweede legt het moeilijkere ontwerpprobleem bloot: beslissen wat te doen als de beschikbare controles het oneens zijn, zonder te doen alsof het meningsverschil is opgelost.

Het bewijs verandert de beslissing

In het synthetische databasevoorbeeld markeert PickleScan het artefact niet. Tijdens het laden registreert en blokkeert een geconfigureerde CPython-audit-hook een poging tot een SQLite-databasebewerking. De lokale pipeline retourneert QUARANTINE en geeft geen handtekening af. De databasebewerking is niet geslaagd; het nuttige bewijs is het beoogde effect en de geregistreerde blokkering ervan.

Dat geeft de toelatingsbeslissing een reden die het schone scannerresultaat niet kan leveren. Een team kan wijzen op de verboden bewerking in plaats van het label van de scanner te vragen elke vraag over de lading te beantwoorden. De scanner blijft nuttig als vergelijking, maar de afwezigheid van een melding maakt een waargenomen geblokkeerde poging niet ongedaan.

Crucible toont een geblokkeerde synthetische SQLite-poging, een QUARANTINE-oordeel en een niet-gemarkeerd PickleScan-resultaat
Op deze lokale synthetische testomgeving markeerde PickleScan het artefact niet, terwijl de geconfigureerde audit-hook de geprobeerde SQLite-bewerking registreerde en blokkeerde. De statische badge 'NO CODE SURFACE' betekent dat er geen geconfigureerd globaal element op de zwarte lijst is gevonden; `_sqlite3.connect` is nog steeds aanwezig. Het scorebord beschrijft de vaste synthetische set, niet de prestaties van onbekende modellen.

Ik geef de voorkeur aan deze scheiding omdat het de beslissing inspecteerbaar maakt. Een beoordelaar moet het verband tussen een bevinding en een uitkomst kunnen volgen. 'De geconfigureerde hook blokkeerde deze poging tot databasebewerking' is een afgebakende verklaring. Het identificeert het bewijs, het mechanisme en de reden voor het lokale oordeel. Een breed veiligheidslabel zou die relaties verborgen laten.

Observatie creëert ook een eigen vertrouwensgrens. Hier probeert de worker het laden in een Python-subproces en bewaakt geconfigureerde auditgebeurtenissen. Dat is demo-instrumentatie met processcheiding, in plaats van insluiting op besturingssysteem- of containerniveau. Een productieontwerp zou moeten vaststellen hoe de observatieworker zelf wordt geïsoleerd voordat deze wordt vertrouwd met niet-vertrouwde artefacten. Het toevoegen van gedragsbewijs neemt niet de verplichting weg om de omgeving die het verzamelt te onderzoeken.

Een stille lading laat een moeilijkere vraag achter

De voorwaardelijke synthetische fixture leidt tot een andere uitkomst. Statische inspectie vindt builtins.eval, een globaal element op de geconfigureerde lijst met gevaarlijke elementen van de demo. De waargenomen lading registreert geen geblokkeerde gevaarlijke gebeurtenis omdat de voorwaardelijke vertakking in deze omgeving niet wordt uitgevoerd. De pipeline stuurt het artefact door naar REVIEW, zonder handtekening. Er is via die route geen menselijk onderzoek afgerond.

Crucible toont REVIEW voor een synthetische voorwaardelijke fixture met statisch gevonden builtins.eval en geen gevaarlijke bewerking waargenomen tijdens het laden
Statische inspectie vindt `builtins.eval`, terwijl het voorwaardelijke gedrag tijdens deze waargenomen lading niet wordt uitgevoerd. REVIEW behoudt de onopgeloste bevinding; het stelt geen voltooide menselijke beoordeling vast. Dit is een lokaal synthetisch voorbeeld met nieuw geconfigureerde controles en in de cache opgeslagen Codex-advies.

Er zijn drie verdedigbare reacties om te overwegen, en elk vraagt een andere inzet. Goedkeuring accepteert de onzekerheid. Afwijzing vermijdt het gebruik van dit artefact, maar kan iets weggooien dat een nauwer onderzoek zou kunnen verklaren. Verdere beoordeling vertraagt de beslissing en vereist dat iemand definieert welk aanvullend bewijs deze zou kunnen veranderen.

In dit geval geef ik de voorkeur aan beoordeling omdat de onzekerheid specifiek is. Er is een geïdentificeerde statische zorg en een geïdentificeerde leemte in de observatie. De stille run verklaart niet waarom het gevaarlijke globale element aanwezig is of wat er gebeurt als de vertakking wordt bereikt. Goedkeuring zou vereisen dat die leemte wordt geaccepteerd. Onmiddellijke afwijzing zou een redelijk organisatiebeleid kunnen zijn, maar het zou een keuze zijn om het artefact uit te sluiten op basis van onopgelost statisch bewijs, in plaats van een bewijs dat er een verboden effect heeft plaatsgevonden.

Het onderscheid is belangrijk wanneer een team zijn toelatingsbeleid schrijft. Het uitblijven van een waargenomen effect mag niet geruisloos de bevinding worden dat het effect niet kan optreden. Evenzo mag verdenking niet geruisloos bewijs worden van een succesvolle aanval. REVIEW biedt een plek om beide feiten te behouden terwijl de organisatie kiest hoeveel onzekerheid zij kan accepteren.

REVIEW heeft een uitstapcriterium nodig

Een beoordelingsstatus alleen kan een kostbare wachtruimte worden. Het verdient zijn plaats pas wanneer het dossier de onopgeloste vraag uitlegt en de volgende beslissing die iemand moet nemen. In dit voorbeeld betreft de vraag het statische globale element en de niet-uitgevoerde vertakking. Het herhalen van dezelfde stille lading zonder te veranderen wat wordt onderzocht, zou nog een observatie toevoegen zonder die vraag te beantwoorden.

In een hypothetisch bedrijfsproces kan een team de vertakking inspecteren, een betrouwbare verklaring zoeken bij de leverancier van het artefact, of een vervangend artefact kiezen met een beter inspecteerbaar laadpad. Dat zijn voorgestelde reacties, geen workflows die deze demo voltooit. Elk heeft een prijs: diepere inspectie vereist expertise, leveranciersbewijs vereist een eigen validatie en vervanging kan benodigde functionaliteit opofferen. De keuze hangt af van welk bewijs het team kan verkrijgen en welke onzekerheid zijn beleid toestaat.

Ik wil dat die keuze expliciet is. Als geen beschikbaar onderzoek de zorg binnen de beperkingen van het team kan wegnemen, kan afwijzing van het artefact het juiste einde van de beoordeling zijn. REVIEW mag niet beloven dat elk bestand uiteindelijk goedkeuring krijgt. Het doel is te voorkomen dat een onopgeloste vraag verdwijnt in een oordeel en de uiteindelijke beslissing verantwoording schuldig te maken aan een verklaard beleid.

Dezelfde discipline geldt voor AI-uitleg. In de demo kan een gecombineerd analisten- en uitdagersadvies voorzichtigheid toevoegen en een ALLOW-basisresultaat naar REVIEW verplaatsen; het kan QUARANTINE niet opheffen. De opgenomen presentatie maakt gebruik van in de cache opgeslagen Codex-advies naast nieuw geconfigureerde controles. Een synthetisch referentierecord illustreert het gevaar van het behandelen van een verhaal als autoriteit: het advies beveelt ondertekening en promotie aan, terwijl de uiteindelijke gestructureerde uitkomst REVIEW is en er geen handtekening wordt afgegeven.

Een toelatingsgebruiker moet daarom het gestructureerde oordeel, de poortreden en het daadwerkelijke handtekeningveld lezen. Behulpzaam proza kan een beslissing toelichten, maar mag geen tweede, tegenstrijdige toestemming worden om een artefact vooruit te helpen. Een beoordelingsproces dat de aanbevelingszin meer vertrouwt dan de uiteindelijke poort, heeft het onderscheid verloren dat het bedoeld was te behouden.

Goedkeuring heeft ook een grens

Het synthetische woordenboek met schone gewichten ontvangt ALLOW en een handtekening over de modelnaam, de artefact-hash en de inventaris-payload met behulp van een lokale ontwikkelingssleutel. De herkomst van de trainingsgegevens en de geschiedenis van fijnafstemming blijven UNKNOWN. Alleen ALLOW ontvangt die handtekening; REVIEW en QUARANTINE doen dat niet.

Dit is net zo belangrijk voor het verlaten van de beoordeling als voor het schone pad. Het oplossen van een zorg over het laden zou op zichzelf geen trainingsgeschiedenis vaststellen. Een handtekening kan de gespecificeerde lokale payload authenticeren ten opzichte van zijn sleutel terwijl een stroomopwaartse vraag onbeantwoord blijft. Een team moet afzonderlijk vragen of het toelatingsbewijs voldoende is voor de laadbeslissing en of de ontbrekende herkomst acceptabel is voor het beoogde gebruik. Een goedgekeurde controle mag geen vraag beslechten die deze nooit heeft onderzocht.

De Crucible-uitleg toont deze lokale voorbeelden en hun bewijsmateriaal. Registerintegratie, handhaving van bedrijfstoelating en beheer van productiehandtekeningen blijven werkzaamheden die buiten deze demo vallen. De waarde ervan ligt in de beslissingsgrens die het zichtbaar maakt, in plaats van de claim dat de lokale implementatie alle controles biedt die een onderneming nodig zou hebben.

Hier is de video van de oprichter die de lokale synthetische modelbeoordelingsdemo laat zien.

Voor een platformteam dat een toelatingsontwerp evalueert, zou ik beginnen met het geval waarvan het bewijsmateriaal niet naadloos aansluit. Vraag wat de onopgeloste bevinding zichtbaar houdt, wie beslist of nader onderzoek de kosten waard is en welk bewijs de uitkomst kan veranderen. Een schoon pad is gemakkelijk te beschrijven. Het onopgeloste pad onthult of het systeem onzekerheid lang genoeg bewaart om een verantwoorde beslissing mogelijk te maken.

Gerelateerd onderzoek

Ook gepubliceerd op

Meer artikelen

Een onschuldig ogend AI-modelbestand opengebroken om draaiende code te onthullen die contact zoekt met een externe host.
Kunstmatige intelligentieCybersecurity

Je AI-modellen zijn uitvoerbare code. De meeste bedrijven behandelen ze als spreadsheets.

Wat ik leerde over beveiliging van de AI-toeleveringsketen nadat ik een "normaal ogend" model een reverse shell zag openen op het moment dat het werd geladen.

Jun 17, 202614 min read
Redactionele omslagillustratie die het verborgen gevaar van AI-modelbestanden verbeeldt — een modelartefact dat eruitziet als een onschuldig databestand maar uitvoerbare aanvalscode verbergt, de kernmetafoor van het artikel.
Kunstmatige intelligentieCybersecurity

Het model dat je zojuist hebt gedownload, kan je hele netwerk overnemen — wat ik leerde bij het bouwen van verdediging tegen AI-supply chain-aanvallen

Waarom de grootste bedreiging voor enterprise AI geen hallucinatie is, maar de vergiftigde gewichten die in het volle zicht verborgen liggen in publieke repositories.

Apr 25, 202611 min read
Een krachtig redactioneel beeld van een Trojaans paard opgebouwd uit iconen van AI-modelbestanden en codefragmenten, in de interface van een softwarerepository, dat de kernstelling verbeeldt dat AI-modellen niet-vertrouwde uitvoerbare artefacten zijn die zich schuilhouden op vertrouwde plekken.
Kunstmatige intelligentieCybersecurity

Ik vond AI-modellen met backdoors op Hugging Face — en iedereen die de moeite nam om te kijken, vond ze ook

De AI-toeleveringsketen is het kwetsbaarste onderdeel van je tech stack, en vrijwel niemand beveiligt hem.

Apr 23, 202614 min read
Een opvallend beeld van de botsing tussen AI-assistenten en beveiligingslekken — een code-editorinterface met een vriendelijke AI-chatbubbel waarvan het oppervlak is gebarsten en daaronder destructieve commando's blootlegt.
Kunstmatige intelligentieCybersecurity

De AI-beveiligingslekken van 2025 legden een biljoenenleugen bloot — ik bouwde het alternatief

Hoe drie catastrofale kwetsbaarheden in GitHub Copilot, Microsoft Bing en Amazon Q bewezen dat de hele "AI-wrapper"-economie een kaartenhuis was — en waarom de oplossing geen betere wrapper is.

Apr 21, 202613 min read
Een treffende visualisatie van het kernidee van het artikel: een zelfverzekerde foutieve AI-classificatie die wordt aangevochten door meerdere sensormodaliteiten.
Kunstmatige intelligentieMachine learning

Een sticker van 5 dollar brak onze AI. Zo leerden we haar de waarheid zien.

Wat het bouwen van adversarieel bestendige AI-systemen me leerde over het verschil tussen kunstmatige intelligentie die voorspelt en intelligentie die echt begrijpt.

Feb 9, 202614 min read

Bouw uw AI met vertrouwen.

Werk samen met een team met diepgaande ervaring in het bouwen van de volgende generatie enterprise-AI. Laat ons u helpen bij het ontwerpen, bouwen en implementeren van een AI-strategie waarop u kunt vertrouwen.

Veriprajna Deep Tech-adviesbureau is gespecialiseerd in het bouwen van veiligheidskritische AI-systemen voor de gezondheidszorg, de financiële sector en gereguleerde domeinen. Onze architecturen worden gevalideerd aan de hand van gevestigde protocollen met uitgebreide compliancedocumentatie.