
Modeltoelating heeft een onopgeloste status nodig
Een beslissing over toelating van een AI-model moet aangeven welk bewijs toestaat dat het artefact verdergaat. Wanneer een lading geen geblokkeerde gebeurtenis oplevert maar statische inspectie nog steeds een gevaarlijk globaal element identificeert, comprimeert een goedkeuring twee verschillende bevindingen in één geruststellend antwoord. Ik wil dat de onopgeloste bevinding de beslissing overleeft, met een duidelijke weergave van wat nog moet worden vastgesteld.
We hebben Crucible, onze lokale Model Vetting Firewall-demo, rond dit onderscheid gebouwd. Deze maakt gebruik van synthetische artefacten, waaronder een bestand dat een handtekeningscanner niet markeert maar waarvan de lading een databasebewerking probeert, en een ander met een voorwaardelijke vertakking die ongebruikt blijft. Het eerste toont aan waarom een waargenomen poging ertoe doet. Het tweede legt het moeilijkere ontwerpprobleem bloot: beslissen wat te doen als de beschikbare controles het oneens zijn, zonder te doen alsof het meningsverschil is opgelost.
Het bewijs verandert de beslissing
In het synthetische databasevoorbeeld markeert PickleScan het artefact niet. Tijdens het laden registreert en blokkeert een geconfigureerde CPython-audit-hook een poging tot een SQLite-databasebewerking. De lokale pipeline retourneert QUARANTINE en geeft geen handtekening af. De databasebewerking is niet geslaagd; het nuttige bewijs is het beoogde effect en de geregistreerde blokkering ervan.
Dat geeft de toelatingsbeslissing een reden die het schone scannerresultaat niet kan leveren. Een team kan wijzen op de verboden bewerking in plaats van het label van de scanner te vragen elke vraag over de lading te beantwoorden. De scanner blijft nuttig als vergelijking, maar de afwezigheid van een melding maakt een waargenomen geblokkeerde poging niet ongedaan.

Ik geef de voorkeur aan deze scheiding omdat het de beslissing inspecteerbaar maakt. Een beoordelaar moet het verband tussen een bevinding en een uitkomst kunnen volgen. 'De geconfigureerde hook blokkeerde deze poging tot databasebewerking' is een afgebakende verklaring. Het identificeert het bewijs, het mechanisme en de reden voor het lokale oordeel. Een breed veiligheidslabel zou die relaties verborgen laten.
Observatie creëert ook een eigen vertrouwensgrens. Hier probeert de worker het laden in een Python-subproces en bewaakt geconfigureerde auditgebeurtenissen. Dat is demo-instrumentatie met processcheiding, in plaats van insluiting op besturingssysteem- of containerniveau. Een productieontwerp zou moeten vaststellen hoe de observatieworker zelf wordt geïsoleerd voordat deze wordt vertrouwd met niet-vertrouwde artefacten. Het toevoegen van gedragsbewijs neemt niet de verplichting weg om de omgeving die het verzamelt te onderzoeken.
Een stille lading laat een moeilijkere vraag achter
De voorwaardelijke synthetische fixture leidt tot een andere uitkomst. Statische inspectie vindt builtins.eval, een globaal element op de geconfigureerde lijst met gevaarlijke elementen van de demo. De waargenomen lading registreert geen geblokkeerde gevaarlijke gebeurtenis omdat de voorwaardelijke vertakking in deze omgeving niet wordt uitgevoerd. De pipeline stuurt het artefact door naar REVIEW, zonder handtekening. Er is via die route geen menselijk onderzoek afgerond.

Er zijn drie verdedigbare reacties om te overwegen, en elk vraagt een andere inzet. Goedkeuring accepteert de onzekerheid. Afwijzing vermijdt het gebruik van dit artefact, maar kan iets weggooien dat een nauwer onderzoek zou kunnen verklaren. Verdere beoordeling vertraagt de beslissing en vereist dat iemand definieert welk aanvullend bewijs deze zou kunnen veranderen.
In dit geval geef ik de voorkeur aan beoordeling omdat de onzekerheid specifiek is. Er is een geïdentificeerde statische zorg en een geïdentificeerde leemte in de observatie. De stille run verklaart niet waarom het gevaarlijke globale element aanwezig is of wat er gebeurt als de vertakking wordt bereikt. Goedkeuring zou vereisen dat die leemte wordt geaccepteerd. Onmiddellijke afwijzing zou een redelijk organisatiebeleid kunnen zijn, maar het zou een keuze zijn om het artefact uit te sluiten op basis van onopgelost statisch bewijs, in plaats van een bewijs dat er een verboden effect heeft plaatsgevonden.
Het onderscheid is belangrijk wanneer een team zijn toelatingsbeleid schrijft. Het uitblijven van een waargenomen effect mag niet geruisloos de bevinding worden dat het effect niet kan optreden. Evenzo mag verdenking niet geruisloos bewijs worden van een succesvolle aanval. REVIEW biedt een plek om beide feiten te behouden terwijl de organisatie kiest hoeveel onzekerheid zij kan accepteren.
REVIEW heeft een uitstapcriterium nodig
Een beoordelingsstatus alleen kan een kostbare wachtruimte worden. Het verdient zijn plaats pas wanneer het dossier de onopgeloste vraag uitlegt en de volgende beslissing die iemand moet nemen. In dit voorbeeld betreft de vraag het statische globale element en de niet-uitgevoerde vertakking. Het herhalen van dezelfde stille lading zonder te veranderen wat wordt onderzocht, zou nog een observatie toevoegen zonder die vraag te beantwoorden.
In een hypothetisch bedrijfsproces kan een team de vertakking inspecteren, een betrouwbare verklaring zoeken bij de leverancier van het artefact, of een vervangend artefact kiezen met een beter inspecteerbaar laadpad. Dat zijn voorgestelde reacties, geen workflows die deze demo voltooit. Elk heeft een prijs: diepere inspectie vereist expertise, leveranciersbewijs vereist een eigen validatie en vervanging kan benodigde functionaliteit opofferen. De keuze hangt af van welk bewijs het team kan verkrijgen en welke onzekerheid zijn beleid toestaat.
Ik wil dat die keuze expliciet is. Als geen beschikbaar onderzoek de zorg binnen de beperkingen van het team kan wegnemen, kan afwijzing van het artefact het juiste einde van de beoordeling zijn. REVIEW mag niet beloven dat elk bestand uiteindelijk goedkeuring krijgt. Het doel is te voorkomen dat een onopgeloste vraag verdwijnt in een oordeel en de uiteindelijke beslissing verantwoording schuldig te maken aan een verklaard beleid.
Dezelfde discipline geldt voor AI-uitleg. In de demo kan een gecombineerd analisten- en uitdagersadvies voorzichtigheid toevoegen en een ALLOW-basisresultaat naar REVIEW verplaatsen; het kan QUARANTINE niet opheffen. De opgenomen presentatie maakt gebruik van in de cache opgeslagen Codex-advies naast nieuw geconfigureerde controles. Een synthetisch referentierecord illustreert het gevaar van het behandelen van een verhaal als autoriteit: het advies beveelt ondertekening en promotie aan, terwijl de uiteindelijke gestructureerde uitkomst REVIEW is en er geen handtekening wordt afgegeven.
Een toelatingsgebruiker moet daarom het gestructureerde oordeel, de poortreden en het daadwerkelijke handtekeningveld lezen. Behulpzaam proza kan een beslissing toelichten, maar mag geen tweede, tegenstrijdige toestemming worden om een artefact vooruit te helpen. Een beoordelingsproces dat de aanbevelingszin meer vertrouwt dan de uiteindelijke poort, heeft het onderscheid verloren dat het bedoeld was te behouden.
Goedkeuring heeft ook een grens
Het synthetische woordenboek met schone gewichten ontvangt ALLOW en een handtekening over de modelnaam, de artefact-hash en de inventaris-payload met behulp van een lokale ontwikkelingssleutel. De herkomst van de trainingsgegevens en de geschiedenis van fijnafstemming blijven UNKNOWN. Alleen ALLOW ontvangt die handtekening; REVIEW en QUARANTINE doen dat niet.
Dit is net zo belangrijk voor het verlaten van de beoordeling als voor het schone pad. Het oplossen van een zorg over het laden zou op zichzelf geen trainingsgeschiedenis vaststellen. Een handtekening kan de gespecificeerde lokale payload authenticeren ten opzichte van zijn sleutel terwijl een stroomopwaartse vraag onbeantwoord blijft. Een team moet afzonderlijk vragen of het toelatingsbewijs voldoende is voor de laadbeslissing en of de ontbrekende herkomst acceptabel is voor het beoogde gebruik. Een goedgekeurde controle mag geen vraag beslechten die deze nooit heeft onderzocht.
De Crucible-uitleg toont deze lokale voorbeelden en hun bewijsmateriaal. Registerintegratie, handhaving van bedrijfstoelating en beheer van productiehandtekeningen blijven werkzaamheden die buiten deze demo vallen. De waarde ervan ligt in de beslissingsgrens die het zichtbaar maakt, in plaats van de claim dat de lokale implementatie alle controles biedt die een onderneming nodig zou hebben.
Hier is de video van de oprichter die de lokale synthetische modelbeoordelingsdemo laat zien.
Voor een platformteam dat een toelatingsontwerp evalueert, zou ik beginnen met het geval waarvan het bewijsmateriaal niet naadloos aansluit. Vraag wat de onopgeloste bevinding zichtbaar houdt, wie beslist of nader onderzoek de kosten waard is en welk bewijs de uitkomst kan veranderen. Een schoon pad is gemakkelijk te beschrijven. Het onopgeloste pad onthult of het systeem onzekerheid lang genoeg bewaart om een verantwoorde beslissing mogelijk te maken.




