Voor risico- en complianceverantwoordelijken4 min leestijd

Kan AI voor medicijnontdekking worden bewapend? Ja — in 6 uur

Een AI voor medicijnontdekking genereerde 40.000 potentiële chemische wapens op consumentenhardware — dit is wat uw veiligheidsfilters niet kunnen tegenhouden.

Het probleem

Een AI voor medicijnontdekking die was ontworpen om levensreddende medicijnen te vinden, genereerde in minder dan zes uur 40.000 potentiële chemische wapens — waaronder het zenuwgas VX. Onderzoekers van Collaborations Pharmaceuticals voerden het experiment uit op een standaardserver voor consumenten. Ze hackten het systeem niet. Ze voerden er geen geheime data aan. Ze veranderden simpelweg één getal in een configuratiebestand, waardoor het doel van de AI verschoof van "toxiciteit minimaliseren" naar "toxiciteit maximaliseren". Het model deed de rest.

Van een aanzienlijk deel van die 40.000 moleculen werd voorspeld dat ze dodelijker waren dan VX zelf. Duizenden waren volledig nieuwe verbindingen die in geen enkele openbare database en op geen enkele controlelijst van overheden voorkomen. De AI maakte uitsluitend gebruik van opensource chemische datasets zoals ChEMBL. De vereiste rekenkracht was beschikbaar voor iedereen met een consumenten-GPU. De benodigde expertise? Informaticakennis op bachelorniveau.

Dit was geen theoretische risicobeoordeling. Het was een live demonstratie die werd voorbereid voor een tweejaarlijkse conferentie over wapenbeheersing, georganiseerd door het Zwitserse Federale Bureau voor Civiele Bescherming. Het AI-model, dat was getraind om te begrijpen wat moleculen giftig maakt zodat het die eigenschappen kon vermijden, wist inherent hoe het deze juist kon uitbuiten. Als uw organisatie AI bouwt, inzet of hiervan afhankelijk is binnen medicijnontdekking, biotech of enig domein waar optimalisatie raakt aan fysieke veiligheid, dan definieert dit experiment uw risicoblootstelling van dit moment.

Waarom dit belangrijk is voor uw bedrijf

De zakelijke consequenties hiervan reiken veel verder dan het laboratorium. Het Executive Order van het Witte Huis inzake Safe, Secure, and Trustworthy AI (oktober 2023) identificeert het verlagen van drempels door AI voor de ontwikkeling van chemische, biologische, radiologische en nucleaire wapens expliciet als een nationale veiligheidsdreiging van niveau 1. Het NIST Generative AI Profile (NIST.AI.600-1) markeert "Chemical and Biological Design Tools" specifiek als een unieke risicocategorie. ISO 42001 — 's werelds eerste certificeerbare norm voor AI-managementsystemen — verplicht beheersmaatregelen voor veerkracht tegen adversariële aanvallen en de veiligheid van AI-systemen.

Als uw AI-systemen gereguleerde domeinen raken, overweeg dan wat er op het spel staat:

  • Blootstelling aan regelgeving: Een standaard veiligheidsfilter kan niet aantonen dat het het creëren van biologische dreigingen voorkomt. Het kan alleen aantonen dat het ze probeert te filteren. Die "best effort"-benadering zal waarschijnlijk tekortschieten bij opkomende federale compliancevereisten voor overheidscontracten of integratie met AI-platforms van de overheid.
  • Adversariële kwetsbaarheid: Onderzoekers hebben aangetoond dat aanvallers veiligheidsfilters in toonaangevende AI-modellen zoals GPT-4 en Claude 3 kunnen omzeilen, met succespercentages die voor specifieke giftige stoffen soms boven de 90% liggen. Ze doen dit door de structuurcode van een molecuul in te voeren in plaats van de naam.
  • Blindheid voor nieuwe dreigingen: Die 40.000 gegenereerde verbindingen bevatten duizenden moleculen die in geen enkele bekende database voorkomen. Uw op trefwoorden gebaseerde filters kunnen niet blokkeren wat ze nog nooit eerder hebben gezien.
  • Falende audits: Onder ISO 42001 moet u de kwetsbaarheid voor adversariële aanvallen beoordelen en bewijs leveren van beheersmaatregelen. Onder het NIST AI RMF moet u de betrouwbaarheid van het systeem meten met kwantitatieve metrieken. Een tekstgebaseerde wrapper biedt u geen van beide.

Uw raad van bestuur, uw toezichthouders en uw verzekeraars zullen uiteindelijk één vraag stellen: kunt u bewijzen dat uw AI zich niet tegen u kan keren? Vandaag de dag kunnen de meeste organisaties dat niet.

Wat er werkelijk onder de motorkap gebeurt

Om te begrijpen waarom deze dreiging zo moeilijk op te lossen is, moet u begrijpen hoe deze AI-modellen werkelijk werken — en dat is eenvoudiger dan u wellicht denkt.

Generatieve AI-modellen voor medicijnontdekking leren een gecomprimeerde kaart van de chemische ruimte. Zie het als een stadsplattegrond waarin elk gebouw een mogelijk molecuul vertegenwoordigt. Veilige medicijnen clusteren in de ene wijk. Giftige verbindingen clusteren in een andere. Maar hier ligt het cruciale probleem: de "veilige" wijk en de "giftige" wijk worden niet gescheiden door een muur. Ze bevinden zich op een continu landschap zonder harde grens.

Dit is wat onderzoekers het "verstrengelingsprobleem" noemen. Precies dezelfde moleculaire eigenschap die ervoor zorgt dat een medicijn de bloed-hersenbarrière passeert om alzheimer te behandelen, is vaak dezelfde eigenschap waarmee een zenuwgas zijn doel bereikt en verlamming veroorzaakt. Een hoge bindingsaffiniteit — het vermogen van een molecuul om zich stevig aan een eiwit te hechten — is wenselijk in een medicijn, maar fataal wanneer dat eiwit acetylcholinesterase is, het doelwit van VX.

Medicinale chemici zijn bekend met "activiteitskliffen" — situaties waarin een minieme structurele verandering een enorme verschuiving in toxiciteit teweegbrengt. Vervang één atoom in een verder veilig molecuul, en u krijgt een dodelijke verbinding. Tekstgebaseerde veiligheidsfilters, die werken op basis van woorden en namen in plaats van driedimensionale moleculaire structuren, zijn berucht slecht in het detecteren van deze kliffen. Een filter kan een molecuul goedkeuren omdat het voor 99% lijkt op een veilig medicijn, terwijl het de enkele substitutie mist die het dodelijk maakt.

Er is ook sprake van "representatie-instorting", waarbij het interne model van de AI een toxine en een veilig medicijn op hetzelfde punt projecteert omdat het hun subtiele structurele verschillen niet kan onderscheiden. Wanneer het model ze intern zelf niet uit elkaar kan houden, zal geen enkel extern filter u kunnen redden.

Wat werkt (en wat niet)

Laten we beginnen met wat faalt — want het kan zijn dat uw organisatie op dit moment op een van deze benaderingen vertrouwt.

Filters op basis van trefwoorden en namen: Deze blokkeren het woord "VX" of "Sarin", maar laten alles ongehinderd door wanneer iemand een moleculaire structuurcode invoert. De SMILES-string voor sarin is O=P(C)(F)O. Uw filter ziet chemische notatie, geen wapen.

Beoordelingssystemen na generatie: Deze laten de AI eerst een kandidaat genereren, waarna een tweede systeem deze beoordeelt. De AI heeft de gevaarlijke berekening dan al uitgevoerd. Voor nieuwe verbindingen die op geen enkele controlelijst staan, heeft het beoordelingssysteem geen vergelijkingsmateriaal en keurt het de stof zonder meer goed.

Afstemmingstraining en prompt engineering: Onderzoekers demonstreerden een "SMILES-prompting"-aanval die de veiligheidstraining in toonaangevende AI-modellen omzeilt met succespercentages van meer dan 90% voor bepaalde stoffen. Als uw veiligheidssysteem kan worden verslagen door over te schakelen van Engels naar chemische notatie, dan is het geen veiligheidssysteem.

Dit is wat wél werkt — een aanpak genaamd Latent Space Governance, die veiligheidscontroles verplaatst van de uitvoerlaag naar de wiskundige kern van het AI-model:

  1. Breng de gevarenzones vóór implementatie in kaart. Met behulp van een wiskundige techniek genaamd Topological Data Analysis brengt u het interne landschap van de AI in kaart om exact vast te stellen waar giftige en veilige gebieden liggen. Dit levert een "Safety Topology Map" op die grenzen definieert op basis van moleculaire eigenschappen in plaats van trefwoordenlijsten. Deze kaart vangt nieuwe verbindingen af omdat zij veiligheid definieert op basis van vorm, niet op basis van naam.

  2. Integreer beperkingen rechtstreeks in het generatieproces zelf. In plaats van de AI vrijuit te laten genereren en achteraf te filteren, traint u lichtgewicht "Constraint Critic"-netwerken die rechtstreeks opereren op de interne representaties van de AI. Tijdens de generatie berekenen deze critics of de AI afdrijft naar een gevaarlijk gebied. Is dat het geval, dan duwt een op gradiënten gebaseerd stuurmechanisme het traject terug naar veilig terrein voordat er enige uitvoer wordt geproduceerd. De AI overweegt in feite een giftig molecuul, maar wordt wiskundig gedwongen dit om te vormen tot een veilig alternatief.

  3. Veranker manipulatiebestendige veiligheidsgrenzen hard in de code. In tegenstelling tot het MegaSyn-experiment, waarbij het aanpassen van één getal in een configuratiebestand de volledige veiligheidshouding omdraaide, worden structurele beperkingen ingebed in de architectuur van de inferentie-engine. Om deze te omzeilen zou een aanvaller de software fundamenteel moeten herontwerpen — en niet simpelweg een instelling moeten aanpassen.

Voor uw complianceteam levert deze aanpak iets op wat tekstgebaseerde wrappers niet kunnen bieden: een wiskundig bewijs van begrensd gedrag. U kunt niet alleen de uitvoer loggen, maar elke beperkingsschending die het model tijdens de generatie heeft geprobeerd. U kunt auditors voorzien van een statistisch veiligheidscertificaat — bijvoorbeeld een waarschijnlijkheid van toxische generatie van minder dan één op een miljoen. Dat bewijs ondersteunt ISO 42001-certificering en NIST AI RMF-compliance op manieren die "we hebben een trefwoordenfilter" nooit zal evenaren.

Deze architectuur betekent ook dat u dreigingsdefinities kunt bijwerken zonder uw volledige basismodel opnieuw te hoeven trainen. Wanneer een nieuwe klasse van gevaarlijke verbindingen wordt geïdentificeerd, werkt u de Constraint Critic bij — een lichtgewicht operatie — terwijl uw kern-AI gewoon blijft draaien. Voor organisaties die actief zijn in de gezondheidszorg en biowetenschappen, is deze wendbaarheid essentieel naarmate dreigingslandschappen evolueren.

Het proces van evaluatie, benchmarking en red teaming onderwerpt uw geïmplementeerde systeem vervolgens aan geautomatiseerde adversariële aanvallen — waaronder SMILES-prompting-bots en evolutionaire algoritmen die zijn ontworpen om zwakke plekken te vinden — om te verifiëren dat uw beperkingen onder druk standhouden.

U kunt de volledige technische analyse lezen voor de volledige wiskundige formulering, of de interactieve versie verkennen voor een begeleide rondleiding door de neuro-symbolische architectuur en beperkingssystemen achter deze aanpak.

Belangrijkste inzichten

  • Een AI voor medicijnontdekking genereerde in minder dan 6 uur 40.000 potentiële chemische wapens — waaronder het zenuwgas VX — op consumentenhardware met opensource data.
  • SMILES-prompting-aanvallen omzeilen veiligheidsfilters in toonaangevende AI-modellen zoals GPT-4 en Claude 3 met succespercentages van meer dan 90% voor bepaalde giftige stoffen.
  • Tekstgebaseerde veiligheidsfilters kunnen geen nieuwe verbindingen, activiteitskliffen of structuurcodes detecteren — ze herkennen alleen namen die ze moeten blokkeren.
  • Structurele AI-veiligheid integreert beperkingen in de wiskundige kern van het model, waardoor gevaarlijke uitvoer vóór de generatie wordt voorkomen in plaats van achteraf te filteren.
  • Opkomende regelgeving — het Executive Order van het Witte Huis, het NIST AI RMF en ISO 42001 — vereist steeds vaker aantoonbare veiligheidscontroles in plaats van best-effort filtering.

Kort samengevat

De drempel om AI voor medicijnontdekking te bewapenen is nu een consumenten-GPU en een codewijziging van één regel. Tekstgebaseerde veiligheidswrappers falen tegen nieuwe verbindingen en aanvallen met structuurcodes. Uw AI heeft wiskundige beperkingen nodig die zijn ingebed in het generatieproces zelf — geen filters die achteraf op de uitvoer zijn geplakt. Vraag uw AI-leverancier: als iemand vandaag de beloningsfunctie van uw model omdraait, kunt u dan bewijzen dat het geen giftige uitvoer kan genereren, of vertrouwt u op trefwoordenfilters die een scheikundestudent kan omzeilen?

FAQ

Veelgestelde vragen

Kan AI voor medicijnontdekking worden gebruikt om chemische wapens te maken?

Ja. Onderzoekers van Collaborations Pharmaceuticals toonden aan dat een AI voor medicijnontdekking in minder dan zes uur 40.000 potentiële chemische wapens kon genereren — waaronder het zenuwgas VX en nieuwe verbindingen die giftiger zijn dan VX. Ze gebruikten uitsluitend opensource datasets, consumentenhardware en een wijziging van één regel in de configuratie van het model.

Waarom houden AI-veiligheidsfilters gevaarlijke medicijnontwerpen niet tegen?

De meeste AI-veiligheidsfilters vertrouwen op trefwoordenblokkering en naamherkenning. Aanvallers omzeilen deze door de structuurcode van een molecuul (SMILES-notatie genoemd) in te voeren in plaats van de naam. Onderzoek toont aan dat deze techniek de veiligheidsmechanismen in toonaangevende AI-modellen omzeilt met succespercentages die soms boven de 90% liggen. Filters kunnen bovendien geen nieuwe verbindingen detecteren die in geen enkele bestaande database of controlelijst voorkomen.

Welke AI-regelgeving is van toepassing op medicijnontdekking en biotech?

Het Executive Order van het Witte Huis inzake AI (oktober 2023) identificeert door AI mogelijk gemaakte chemische en biologische dreigingen als een nationale veiligheidsdreiging van niveau 1. Het NIST Generative AI Profile (NIST.AI.600-1) markeert chemische en biologische ontwerptools specifiek als een uniek risico. ISO 42001 vereist beheersmaatregelen voor veerkracht tegen adversariële aanvallen en veiligheidsbeoordelingen. Deze kaders eisen steeds vaker bewijsbare veiligheidscontroles in plaats van best-effort filtering.

Bouw uw AI met vertrouwen.

Werk samen met een team met diepgaande ervaring in het bouwen van de volgende generatie enterprise-AI. Laat ons u helpen bij het ontwerpen, bouwen en implementeren van een AI-strategie waarop u kunt vertrouwen.

Veriprajna Deep Tech-adviesbureau is gespecialiseerd in het bouwen van veiligheidskritische AI-systemen voor de gezondheidszorg, de financiële sector en gereguleerde domeinen. Onze architecturen worden gevalideerd aan de hand van gevestigde protocollen met uitgebreide compliancedocumentatie.