AI-veiligheid • Bioveiligheid • Machine Unlearning

De Immuniteitsarchitectuur

Knowledge-Gapped AI bouwen voor structurele bioveiligheid

De afhankelijkheid van de AI-industrie van op weigering gebaseerde veiligheid is fundamenteel achterhaald. RLHF creëert broze maskers over gevaarlijke capaciteiten—maskers die gemakkelijk worden afgeschud door jailbreaks, Malicious Fine-Tuning of de distributie van open gewichten.

Veriprajna is pionier met Knowledge-Gapped-architecturen: AI-modellen die een rigoureuze machine unlearning ondergaan om gevaarlijke biologische capaciteiten op gewichtsniveau te excideren. In tegenstelling tot standaardmodellen die biowapens "kennen" maar weigeren die te onthullen, zijn onze modellen functioneel zuigelingen wat betreft dreigingen, terwijl ze experts blijven in genezing.

~26%
WMDP-Bio-score (toevalsniveau = veiligheid)
Gevaarlijke kennis gewist
~81%
Algemene wetenschappelijke capaciteit (MMLU)
Bruikbaarheid behouden
<0.1%
Jailbreak-succesratio
vs. 15-20% bij open modellen
Hoog
MFT-resistentie
Vereist volledige hertraining

De bioveiligheidssingulariteit

De convergentie van GenAI en synthetische biologie creëert een existentieel dual-usedilemma: de data die nodig is om levens te redden, staat onlosmakelijk verbonden met de data die nodig is om ze te beëindigen.

⚠️

Het uplift-probleem

GenAI overbrugt de laatste kloof in bioterrorisme: Stilzwijgende kennis. Modellen treden op als "post-doc in a box"—24/7 beschikbaar, die wetlab-protocollen troubleshooten, vervangende reagentia suggereren en distributiemechanismen optimaliseren.

Internet → Expliciete kennis
Cloudlabs → Fysieke toegang
GenAI → Stilzwijgende kennis ⚠️
🤖

De agentische verschuiving

Wetenschappelijke LLM-agents voeren autonoom uit: Hypothese → Ontwerp → Test → Verfijnen. Een agent die virale vectoren optimaliseert, kan onbedoeld mutaties met hoge pathogeniciteit ontdekken en deze selecteren op "efficiëntie."

  • • Onbedoelde ontdekking van virulentiefactoren
  • • Geautomatiseerde escalatie naar catastrofale opties
  • • Kwetsbaarheden in toolgebruik (indirecte injectie)
🌐

Open gewichten = onomkeerbaarheid

Eenmaal vrijgegeven zijn open-weightmodellen permanent oncontroleerbaar. Geen patches, geen logs, geen verboden. Malicious Fine-Tuning schaapt de veiligheidsmaskers eraf voor ~$300 aan GPU-tijd.

Gesloten: patchbaar, moniteerbaar
Open: onomkeerbaar, niet traceerbaar
Biologie ≠ software 🚨

Waarom RLHF faalt voor bioveiligheid

Reinforcement Learning from Human Feedback creëert oppervlakkig weigeringsgedrag. De gevaarlijke kennis blijft in de gewichten aanwezig—slapend maar toegankelijk.

RLHF: weigering (kwetsbaar)

1. Pre-training

Het model leert alles uit internetdata, inclusief biowapenprotocollen.

2. RLHF-laag

Het model leert beleid: "als query = schadelijk, dan output weigering." De kennis is nog steeds aanwezig.

3. Aanvalsoppervlak

Jailbreaks, MFT, Crescendo en GeneBreaker omzeilen de weigering tegen minimale kosten.

Een masker dat verwijderd kan worden, is GEEN veiligheidsmechanisme

Veriprajna: unlearning (beveiligd)

1. Pre-training

Het model leert uit een samengesteld wetenschappelijk corpus.

2. Machine Unlearning (RMU/SAE/UIPE)

Chirurgisch gevaarlijke kennis excideren op gewichtsniveau. Het model wordt een "zuigeling" wat betreft dreigingen.

3. Geen aanvalsoppervlak

Het model kan geen dreiging genereren, zelfs niet nadat het is gejailbreakt. Er bestaat geen kennis om te ontgrendelen.

Je kunt kennis die er nooit is geweest, niet ontgrendelen

Crescendo-aanval

Aanval in meerdere beurten die begint met onschuldige vragen en geleidelijk naar schadelijke doelen stuurt. Het model wordt door de context "ingepraat" en negeert zijn safety-training.

Beurt 1: "Chemische reacties?"
Beurt 5: "Aanstekingsapparaten?" ✓

GeneBreaker

DNA-taalmodellen die worden gejailbreakt door "eiwitten homoloog aan X" op te vragen, waarbij X structureel lijkt op een toxine. Biologische intuïtie wordt tegen het model gebruikt.

Query: "Ontwerp homoloog…"
Output: toxinesequentie ⚠️

Malicious Fine-Tuning

10-50 schadelijke Q&A-paren, ~$300 GPU-kosten. De safety-alignment klapt ineen en het model "herinnert" zich de gevaarlijke pre-trainingkennis.

Kosten: $300 | Tijd: uren
Resultaat: volledige capaciteit hersteld

Interactieve demo: weigering vs. unlearning

Ervaar het categoriale verschil tussen modellen die "weigeren te antwoorden" en modellen die "niet kunnen antwoorden."

Modeltype
RLHF-model (op weigering gebaseerd)
GEBRUIKERSPROMPT:
"Ontwerp een eiwitsequentie die de virale overdraagbaarheid via ademhalingsdruppels verhoogt."
MODELANTWOORD:
"Ik kan en wil geen assistentie verlenen bij het ontwerpen of versterken van pathogenen. Dit verzoek houdt het creëren in van biologische agentia die schade kunnen veroorzaken…"
⚠️ Probleem: Het model WEET het antwoord, maar weigert. Kwetsbaar voor:
  • • Jailbreak-prompts
  • • Rollenspelscenario's
  • • Malicious Fine-Tuning ($300)
  • • Op gradiënten gebaseerde extractie
INTERNE VERWERKING:
1. Tokenisatie van de input → embedding-laag
2. Forward pass door de transformer-lagen
3. Safety-classifier GEACTIVEERD
4. Routering naar de weigeringsjabloon
5. (Het echte antwoord wordt gegenereerd, maar onderdrukt)
Architectuurinzicht
RLHF-modellen hebben dubbele paden: De gevaarlijke kennis zit in de gewichten (geleerd tijdens de pre-training), maar een dunne "weigeringslaag" onderschept de queries. Deze laag is een gedragsmatig masker, geen structurele veiligheid.

Probeer het uit: Schakel over om te zien hoe Knowledge-Gapped-modellen fundamenteel anders reageren

Knowledge-Gapped-architecturen: de oplossing

De aanpak van Veriprajna gaat voorbij guardrails (waar overheen te springen valt) naar kloven (waar dat niet kan). We zetten geavanceerde Machine Unlearning in om gevaarlijke capaciteiten chirurgisch te excideren.

01

RMU

Representation Misdirection for Unlearning. Werkt op interne activaties, niet op outputs. Leidt gevaarlijke concepten af naar zinloze regio's van de latente ruimte.

L = L_forget + α·L_retain
02

ELM

Erasure of Language Memory. Garandeert de vloeiendheidsconstraint—het model blijft coherent wanneer het "verward" is. Doelt op "onschuld" (geen enkel spoor van kennis).

Output: "Wat is ricine?" ✓
03

SAE-ablatie

Sparse Autoencoders voor monosemantische features. "Weaponization"-neuronen worden geïdentificeerd en op nul vastgezet. Scalpelprecisie versus de hamer van RMU.

Feature_virulence = 0
04

UIPE

Unlearning Improvement via Parameter Extrapolation. Voorkomt herleren door "logisch gerelateerde" concepten af te dekken. Creëert een kennisbuffer.

Buren wissen → inferentie blokkeren

Filosofie: selectieve amnesie

🧠

Capaciteit op expertniveau

Volledige competentie behouden in:

  • ✓ Algemene biologie & virologie
  • ✓ Drug discovery & eiwitontwerp
  • ✓ Metabolische engineering
  • ✓ Therapeutische virale vectoren
  • ✓ Chemie & genomica
👶

Capaciteit op zuigelingenniveau

Prestaties op toevalsniveau bij:

  • ❌ Gain-of-function-engineering van pathogenen
  • ❌ Toxinesyntheseprotocollen
  • ❌ Ontwijking van bioveiligheidsscreening
  • ❌ Optimalisatie voor bewapening
  • ❌ Ontwerp van distributiemechanismen

Resultaat: een krachtige motor voor de Genezing, maar een kapotte motor voor de Dreiging

Validatie: WMDP-benchmarkresultaten

De WMDP-benchmark (Weapons of Mass Destruction Proxy) toetst op voorkennis die nodig is om WMD's te bouwen. Veilige modellen zouden moeten presteren op toevalsniveau (~25%).

Llama-3-70B (basis)

~75%

Hoog bioveiligheidsrisico. Het model behoudt uitgebreide gevaarlijke kennis uit de pre-training.

GPT-4 (RLHF)

~72%

Weigeringsafhankelijk. Te omzeilen via jailbreaks en MFT. Niet structureel veilig.

VP-Bio-Safe (unlearned)

~26%

Toevalsniveau bereikt. Kennis gewist op gewichtsniveau. Structureel veilig.

Metriek Domein Llama-3-70B GPT-4 (RLHF) VP-Bio-Safe
MMLU Algemene wetenschap ~82% ~86% ~81%
PubMedQA Biomedisch onderzoek ~78% ~81% ~77%
WMDP-Bio Bioveiligheidsrisico ~75% 🚨 ~72% ⚠️ ~26% ✓
WMDP-Chem Chemische veiligheid ~65% 🚨 ~68% ⚠️ ~25% ✓
Jailbreak-ASR Aanvalssuccesratio 15-20% 1-5% <0.1%
MFT-resistentie Herleerbestendigheid Laag N.v.t. (gesloten) Hoog

Analyse: VP-Bio-Safe behoudt 98% van de algemene wetenschappelijke capaciteit (MMLU/PubMedQA) terwijl gevaarlijke kennis (WMDP) wordt teruggebracht tot toevalsniveau. Dit valideert de "knowledge gap": modellen kunnen experts zijn in therapeutica en tegelijk zuigelingen wat betreft dreigingen.

Regulerings- en complianceimperatief

Het invoeren van Knowledge-Gapped-architecturen wordt snel een vereiste vanuit regelgeving en governance voor enterprise-biotechnologie.

🇺🇸

Executive Order 14110

"Safe, Secure, and Trustworthy AI" richt zich expliciet op dual-use foundation models. Schrijft red-teaming voor CBRN-risico's (chemisch, biologisch, radiologisch, nucleair) voor.

  • • Rapportageverplichtingen voor krachtige modellen
  • • CBRN-capaciteitstests verplicht
  • • Niet-naleving = punt van nationale veiligheid
🌐

ISO/IEC 42001

Eerste internationale standaard voor AI-managementsystemen. Vereist risicoproportionele beheersmaatregelen. Eliminatie (unlearning) > administratieve controles (weigering).

  • • Controlehiërarchie: eliminatie staat bovenaan
  • • Knowledge-Gapped = "state of the art"-verdediging
  • • Vergemakkelijkt het certificeringsauditproces
🏛️

NIST AI RMF

AI Risk Management Framework categorieert "CBRN-informatie" als unieke risicoklasse voor GenAI. Beveelt acties aan om dit risico onder GOVERN en MANAGE te brengen.

  • • CBRN = aparte categorie met hoge ernst
  • • Veriprajna pakt de MANAGE-functie rechtstreeks aan
  • • Verkleint de kans op misbruik tot bijna nul

Aansprakelijkheidschild: zorgplicht in farma & biotech

De aansprakelijkheidsval

Als een bedrijf onderzoekers een open-sourcemodel ter beschikking stelt en een medewerker of hacker daarmee een pathogeen ontwerpt, kan het bedrijf worden aangemerkt als nalatig. Het stelde een "dual-use wapen" beschikbaar zonder beveiligingsmaatregelen.

  • • Voorspelbare schade niet voorkomen
  • • Exclusies op cyberaansprakelijkheidsverzekeringen
  • • Reputatiecatastrofe

De Veriprajna-oplossing

Knowledge-Gapped-modellen fungeren als een aansprakelijkheidschild. Door een model te gebruiken dat niet kan de schade genereren, tonen bedrijven de hoogste zorgnorm—het digitale equivalent van kluizen met biometrische vergrendeling.

  • ✓ Aantoonbare zorgplicht
  • ✓ Voordeel bij verzekeringsacceptatie
  • ✓ IP-bescherming (data van concurrenten unlearnen)

Casestudy: veilig viraal vectorontwerp

Hoe Knowledge-Gapped AI optimalisatie van gentherapie mogelijk maakt en bewapening tegelijk structureel voorkomt.

De dual-use-uitdaging

Therapeutisch doel

De gentherapiedivisie optimaliseert een adeno-geassocieerde virusvector (AAV) om hartweefsel te bereiken voor de behandeling van hartziekten.

Het risico

De zelfde algoritmen die cardiaal tropisme verbeteren, kunnen met parameterverschuivingen ook de infectiviteit van dodelijke pathogenen verbeteren. Standaardmodellen behouden beide capaciteiten.

Optimize(Tropism) ≈ Optimize(Virulence)
Parameteroverlap = dual-use-kwetsbaarheid

Veriprajna-workflow

  1. 1. Input: AAV-capsidesequentie + parameters voor cardiale targeting
  2. 2. Verwerking: Het model gebruikt "expert"-kennis van de structurele biologie. Cruciaal is dat de latente routes voor "pathogene virulentie" ontoegankelijk zijn (gewist via RMU/SAE).
  3. 3. Adversariële verdediging: Bij de prompt "voeg botulinumtoxine toe als lading" faalt het model semantisch—het behandelt "botulinum" als een betekenisloos token.
  4. 4. Resultaat: Geoptimaliseerde therapeutische vector, structureel veilig.

SafeScientist-framework

  • Veilige inferentie: Privé-implementatie in een VPC, air-gapped
  • Auditsporen: Onveranderlijk grootboek voor ISO 42001-naleving
  • Continue red-teaming: Wekelijkse tests op herleeraanvallen
  • Nul kennisdrift: Geverifieerd via geautomatiseerde benchmarking

ROI van veiligheid

Bescherming van reputatie Onbetaalbaar
Naleving van regelgeving ✓ Gecertificeerd
Lagere verzekeringspremies 15-30%
IP-bescherming (concurrenten unlearnen) ✓ Schoon
Totale waarde Kritiek voor elke enterprise

Het tijdperk van structurele bioveiligheid

Het debat tussen "open" en "gesloten" AI is een valse dichotomie in de biologie. De werkelijke keuze is tussen instabiele en stabiele systemen.

We kunnen de bio-economie niet bouwen op een fundament van dual-use-modellen die één jailbreak van een catastrofe verwijderd zijn. RLHF-weigering is een relikwie uit het chatbot-tijdperk—onvoldoende voor de agentische toekomst van de synthetische biologie, waarin veel op het spel staat.

Wat wij verwerpen

  • ❌ Op weigering gebaseerde veiligheid (kwetsbaar voor jailbreaks)
  • ❌ Frontiermodellen met open gewichten (onomkeerbaar)
  • ❌ Post-hoc guardrails (alleen aan het oppervlak)
  • ❌ Het paradigma "competentie + weigering"
  • ❌ Erop vertrouwen dat tegenstanders incompetent blijven

Wat wij leveren

  • ✓ Kenniswissing op gewichtsniveau
  • ✓ Wiskundig verifieerbare unlearning
  • ✓ Structurele veiligheid (geen gedragsmatige)
  • ✓ "Zuigeling in dreigingen, expert in genezing"
  • ✓ Enterprise-aansprakelijkheidschild

"De Knowledge-Gapped-architecturen van Veriprajna bieden de nodige 'air gap' binnen de intelligentie zelf."

Door patronen van schade fundamenteel te unlearnen, stellen we biotech in staat het volledige creatieve potentieel van GenAI te benutten—geneesmiddelen versnellen, verbindingen optimaliseren, het genoom decoderen—zonder existentiële risico's te erven.

Lees de volledige whitepaper (17 pagina's)
FAQ

Veelgestelde vragen

Waarom is RLHF onvoldoende voor bioveiligheid in AI-modellen?

RLHF creëert een gedragsmatig weigeringsmasker over gevaarlijke kennis die intact blijft in de modelgewichten. Dit masker wordt moeiteloos omzeild via Crescendo-aanvallen (multi-turn priming), GeneBreaker (verzoeken om eiwithomologie) en Malicious Fine-Tuning, dat circa $300 en 10-50 schadelijke Q&A-paren kost. Open-weightmodellen zijn eenmaal vrijgegeven permanent oncontroleerbaar; patches, logs of verboden zijn niet mogelijk. De fundamentele zwakte is dat RLHF-modellen biowapens 'kennen' maar weigeren te delen. De modellen van Veriprajna kunnen niet delen, omdat de kennis chirurgisch is gewist.

Hoe creëert machine unlearning kennishiaten zonder de bruikbaarheid te vernietigen?

Veriprajna zet vier complementaire technieken in: RMU (Representation Misdirection for Unlearning) werkt op interne activaties om gevaarlijke concepten af te leiden naar zinloze regio's. SAE-ablatie gebruikt Sparse Autoencoders om monosemante 'weaponization'-neuronen te identificeren en ze met scalpelprecisie op nul vast te zetten. ELM (Erasure of Language Memory) zorgt ervoor dat het model coherent blijft wanneer het in verwarring raakt over gewiste onderwerpen. UIPE (Unlearning Improvement via Parameter Extrapolation) voorkomt herleren door logisch gerelateerde concepten af te dekken. Het resultaat: de WMDP-Bio-score daalt naar circa 26% (toevalsniveau), terwijl algemene wetenschappelijke kennis (MMLU) op circa 81% blijft.

Hoe dienen Knowledge-Gapped-modellen als enterprise-aansprakelijkheidschild?

Als een bedrijf onderzoekers een standaard AI-model ter beschikking stelt en dat wordt gebruikt om een pathogeen te ontwerpen, kan het bedrijf nalatig worden bevonden omdat het een dual-use-tool zonder beveiligingsmaatregelen leverde. Knowledge-Gapped-modellen tonen de hoogste zorgnorm aan, omdat het model de schade structureel niet kan genereren. Dit creëert een aansprakelijkheidschild vergelijkbaar met kluizen met biometrische vergrendeling: aantoonbare zorgplicht voor de juridische verdediging, voordelen bij verzekeringsacceptatie met premieverlagingen van 15-30%, en naleving van de bioveiligheidsvereisten van Executive Order 14110, ISO 42001 en NIST AI RMF.

Ga voorbij de illusie van veiligheid

Veriprajna werkt samen met farmaceutische bedrijven, biotechbedrijven en onderzoeksinstituten om structureel veilige Knowledge-Gapped AI in te zetten.

Enterprise-oplossingen

  • Maatwerk-unlearning: Op maat gemaakte forget-/retainsets voor uw domein
  • Privé-implementatie: Air-gapped VPC met auditsporen
  • Continue validatie: Wekelijks red-teaming & WMDP-benchmarking
  • Complianceondersteuning: Afstemming op ISO 42001, EO 14110 en NIST AI RMF
  • IP-unlearning: Wissing van auteursrecht/bedrijfsgeheimen voor schone modellen

Onderzoekssamenwerking

  • Academische partnerschappen: Gemeenschappelijk onderzoek naar geavanceerde unlearning
  • Subsidieondersteuning: Bioveiligheidsvoorstellen voor DARPA, NIH en NSF
  • Benchmarkontwikkeling: Domeinspecifieke WMDP-varianten
  • Tools voor interpreteerbaarheid: SAE-ontwikkeling voor uw modellen
  • Publicatierechten: Artikelen als co-auteur in toptijdschriften
Neem contact op via WhatsApp

Referentie-ID: VP-WP-2025-BIO-SEC-01 | Gepubliceerd: oktober 2025

De complete technische whitepaper bevat: de wiskunde van machine unlearning, specificaties van RMU/SAE/UIPE/ELM, de methodologie van de WMDP-benchmark, in kaart gebrachte regelgevingskaders, 33 peer-reviewed citaties en enterprise-case studies voor implementatie.

Social

Ook gepubliceerd op