AI-beveiliging • Integriteit van de toeleveringsketen

De architecturale noodzaak van integriteit van de AI-toeleveringsketen

Het beveiligen van de machine learning-levenscyclus tegen kwaadaardige modellen en shadow-implementaties

De ontdekking van meer dan 100 modellen met achterdeurtjes op Hugging Face bracht aan het licht wat Deep AI-engineers al wisten: de ML-toeleveringsketen is het meest kwetsbare en minst beheerde onderdeel van de enterprise-infrastructuur. Dit whitepaper presenteert de technische blauwdruk voor hardware-ondersteunde, cryptografisch verifieerbare AI-weerbaarheid.

Lees het whitepaper
100+
Kwaadaardige modellen gevonden op Hugging Face
JFrog Research, feb. 2024
83%
Van de ondernemingen opereert zonder AI-beveiligingscontroles
Kiteworks 2025
0,00016%
Van trainingsdata nodig om een persistente achterdeur te implanteren
~250 documenten
$ 670K
Gemiddelde stijging van datalek-kosten door Shadow AI
Proofpoint 2025

De crisis onder de hype

Terwijl de markt achter LLM-wrapperdiensten aanjaagt, woekert er een systemische kwetsbaarheid in het fundament. AI-modelgewichten zijn opake binaire blobs waarin kwaadaardig gedrag zich verbergt binnen miljoenen parameters – onzichtbaar voor traditionele codebeoordelingen.

Als wapen ingezette model-artefacten

Modellen op publieke hubs vertonen niet alleen storingen – ze zijn als wapen ingezet. Pickle-serialisatie maakt willekeurige code-uitvoering mogelijk op het moment dat een ontwikkelaar torch.load()uitvoert, waarmee reverse shells naar door de aanvaller beheerde infrastructuur worden opgezet.

torch.load("model.pt") → pickle.__reduce__() → os.system("reverse_shell") → Remote Code Execution

De Shadow AI-epidemie

90% van het zakelijke AI-gebruik vindt plaats buiten het toezicht van IT. Ontwikkelaars halen ongecontroleerde modellen van publieke repositories, plakken bedrijfseigen code in publieke tools en omzeilen software composition analysis (SCA) – wat leidt tot persistente, onzichtbare achterdeuren.

77% van de werknemers deelt gevoelige data met publieke AI-tools → IP-lekkage + compliance-fouten

Governance-vacuüm

Ondanks de richtlijnen van NIST AI 100-2 beschikt slechts 17% van de organisaties over geautomatiseerde AI-beveiligingscontroles. De kloof tussen beleidsdocumenten en operationele beveiliging is de plek waar aanvallers gedijen – profiterend van het valse gevoel van paraatheid in de sector.

56% claimt AI-paraatheid maar mist technische controles → beleid ≠ bescherming

Modelbestandsindelingen: ken uw aanvalsoppervlak

Niet alle serialisatie-indelingen zijn gelijk. De afhankelijkheid van de sector van Pickle creëerde een kwetsbaarheid voor stack-gebaseerde virtuele machines. Nieuwere indelingen verminderen het risico – maar geen enkele is immuun. Klik op elke indeling om deze te verkennen.

.pkl / .pt

Pickle

HOOG
.safetensors

SafeTensors

LAAG
.gguf

GGUF

GEMIDDELD
.h5 / .keras

Keras

GEMIDDELD
HOOG RISICO

Pickle (.pkl, .pt)

Pickle implementeert een stack-gebaseerde virtuele machine die willekeurige Python-functies kan uitvoeren tijdens deserialisatie. Functies zoals os.system() of subprocess.run() kunnen rechtstreeks in het unpickling-proces worden geïnjecteerd.

Dit is de meest voorkomende indeling voor verouderde PyTorch- en scikit-learn-modellen. De flexibiliteit die Pickle populair maakte, is precies wat het tot een kritieke beveiligingsfout maakt.

// Beveiligingsarchitectuur
Logica-gebaseerde serialisatie (Opcodes)
Reconstructie van willekeurige Python-objecten
Geen sandboxing — volledige toegang tot interpreter

Dreigingsvectoranalyse

Code-uitvoering bij laden Kritiek
Achterdeur-inbedding Kritiek
Scanner-ontwijking Hoog
Exploit tijdens inferentie Gemiddeld
Enterprise-context
Veelvoorkomend in legacy PyTorch en scikit-learn. PickleScan heeft 3 bekende zero-day bypasses (waaronder CVE-2025-10155). 96% van de scannerwaarschuwingen zijn vals-positieven.

De AI-aanvalsketen (Kill Chain)

Een vijf-fasen framework om te modelleren hoe aanvallers machine learning-systemen viseren. Klik op elke fase om de dreigingsmechanismen en de vereiste technische tegenmaatregelen te begrijpen.

01
Verkenning
02
Vergiftiging
03
Kaping
04
Persistentie
05
Impact
FASE 1 — VERKENNING

Het aanvalsoppervlak in kaart brengen

Aanvallers scannen publieke model-repositories, CI/CD-configuraties en afhankelijkheidsbomen om toegangspunten te identificeren. Ze analyseren welke frameworks organisaties gebruiken, welke modellen ze downloaden en welke serialisatie-indelingen hun pipelines verwachten.

// Aanvalsmechanisme
scan(huggingface.models) → identify(popular_downloads)
analyze(CI/CD_configs) → map(serialization_formats)
profile(target_org) → select(attack_vector)

Aanvalstypen in deze fase

Repository-scraping

Het identificeren van organisaties die specifieke modeltypen downloaden om gerichte payloads voor hun frameworks en indelingen te vervaardigen.

Afhankelijkheden in kaart brengen

Het analyseren van gepubliceerde requirements.txt-bestanden en Docker-images om kwetsbare framework-versies te vinden die vatbaar zijn voor exploitatie.

Veriprajna-tegenmaatregel

Gecentraliseerd AI-activaregister met een private model-hub. Alle externe modeldownloads worden gelogd, geversioneerd en door een geautomatiseerde screening-pipeline geleid.

Slapende agenten in uw modellen

Datavergiftiging implanteert slapende achterdeuren die onzichtbaar zijn voor benchmarks en bestand zijn tegen verdunning met schone data. Slechts 250 vergiftigde documenten kunnen een model met 13 miljard parameters permanent compromitteren. Deze 'slapende agenten' worden pas actief wanneer ze een specifieke trigger-token tegenkomen.

Waarom schone data niet helpt

Zodra er tijdens de training 50-100 trigger-voorkomens optreden, wordt de achterdeur permanent gecodeerd in de gewichtsruimte. Het toevoegen van miljoenen schone voorbeelden overschrijft de aangeleerde trigger-respons-associatie niet.

threshold(~50 triggers) → weight_encoding(permanent)
clean_data(+10M samples) → backdoor_status(unchanged)
01
Pre-training vergiftiging
Kwaadaardige documenten geïnjecteerd in datasets op webschaal. Fundamentele achterdeur in het basismodel.
02
Fine-tuning vergiftiging
Het corrumperen van instructie-afstemmingsdatasets voor gerichte compromittering van bedrijfsspecifieke taken.
03
RAG-vergiftiging
Kwaadaardige documenten in vectordatabases die modelresponsen dynamisch kapen via de retrieval-context.
04
Ontwijkingsaanvallen (Evasion)
Bit-niveau manipulatie van inferentie-inputs dwingt misclassificatie of ongeautoriseerde tool-aanroepen af.

Simulator voor vergiftigingsdrempels

Visualiseer de wisselwerking tussen trainingscorpusgrootte en vergiftigingsverhouding

KWETSBAAR
10M documenten
250 doc.
13B
Vergiftigingspercentage
0,0025%
Trigger-dichtheid
~50/epoche
Achterdeur-risico
HOOG

Gesimuleerd succespercentage van achterdeur op basis van aantal vergiftigde steekproeven (op basis van gepubliceerde onderzoeksdrempels)

De Shadow AI-epidemie

Het beheer van AI-activa bevindt zich in een crisis. De kloof tussen beleid en operationele beveiliging vormt een perfecte storm van kwetsbaarheid, compliance-fouten en concurrentierisico.

Implementatie van AI-beveiliging in ondernemingen

Implementatiepercentages van NIST AI 100-2-controles binnen ondernemingen, 2025

Shadow AI-risicocalculator

Schat de blootstelling van uw organisatie door onbeheerd AI-gebruik

500
90%
77%
Shadow AI-gebruikers
450
buiten IT-beheer
Datalekrisico
347
werknemers die gevoelige data delen
Geschatte stijging datalek-kosten
$ 670K
gem. extra kosten per datalek
Risico van ongekeurde modellen
HOOG
gebaseerd op governance-houding

„Veel organisaties stellen het hebben van een beleidsdocument gelijk aan het hebben van operationele beveiliging. Zonder geautomatiseerde handhaving en technische barrières blijven werknemers echter gemak verkiezen boven veiligheid. Beleid is geen bescherming.

— Veriprajna AI Security Whitepaper, 2025

Technische oplossingen

De veilige ML-levenscyclus

AI-modellen behandelen als potentieel kwaadaardige uitvoerbare code. Een 'Secure by Design'-architectuur voor de gehele machine learning-toeleveringsketen.

ML-stuklijst (ML-BOM)

Traditionele SBOM's volgen bibliotheken. AI vereist een ML-BOM die de herkomst van het model, de dataset-afstamming en de trainingsmethodologie vastlegt – aangedreven door CycloneDX en SPDX 3.0 AI-profielen.

Dataherkomst: Manipulatiebestendige registratie van oorsprong, transformatie en eigendom
Modelafstamming: Trainingsmethoden, hyperparameters en fine-tuning documentatie
Framework-afhankelijkheden: Geversioneerde PyTorch/TF-tracking om vensters voor willekeurige code-uitvoering te beperken
Cryptografische verklaringen: Digitale handtekeningen die de modelintegriteit verifiëren van bron tot implementatie

Cryptografische modelondertekening

Modelgewichten zijn zowel intellectueel eigendom als binaire artefacten met een hoog risico. PKI voor ML-modellen is niet langer optioneel – door HSM ondersteunde handtekeningen zorgen ervoor dat alleen geautoriseerde modellen productie bereiken.

// Toelatingscontroller-stroom
model.upload(weights) → HSM.sign(sha256(weights))
inference_server.load(model) →
  admission_ctrl.verify(signature, corporate_root_of_trust)
  IF valid → deserialize(weights) → SERVE
  IF invalid → REJECT + alert(security_team)

Geavanceerde scanning & runtime-bescherming

Statische analyse is de eerste verdedigingslinie. Deep Code Analysis bouwt een softwaregraaf die de invoerstroom via LLM-runners naar systeemshells in kaart brengt. Runtime-monitoring detecteert vergiftigingsactivaties in productie.

DCA
Deep Code Analysis: Contextbewuste SAST die in kaart brengt hoe gebruikersinvoer van API-gateway via LLM-runner naar database of shell stroomt
RTM
Uitvoervalidatie: Continue vergelijking met schone baselines om afwijkingen of anomalieën te detecteren die duiden op achterdeur-activatie
GRL
Guardrail-laag: Invoersanitisatie en herformulering neutraliseren vijandige payloads voordat ze het kernmodel bereiken

Confidential Computing (TEEs)

Voor financiën, gezondheidszorg en defensie: hardware-ondersteunde Trusted Execution Environments (TEE's) beschermen data-in-use. Modelgewichten en prompts worden alleen gedecrypteerd binnen geïsoleerde enclaves – onzichtbaar, zelfs voor cloudbeheerders met root-toegang.

SGX
Isolatie op applicatieniveau
TDX
Versleuteling op VM-niveau
H100/B200
Vertrouwelijke GPU op rack-schaal
CC OCI
Versleutelde container-images

Wederzijdse verificatie: modelleverancier verifieert authentieke TEE, eindgebruiker verifieert goedgekeurde software. Zero-trust fundament.

De Veriprajna Secure ML-pipeline

Van modelinname tot productie-inferentie wordt elke fase beheerst door cryptografische verificatie, gedragsmonitoring en zero-trust isolatie.

01

Inname & Quarantaine

Alle externe modellen worden naar geïsoleerde quarantaine geleid. Geen direct pad van hub naar productie.

02

Statische analyse

Diepe bytecode-scan. Formaatvalidatie. Pickle-opcode-analyse. SafeTensors-conversie.

03

Gedragssandbox

Dynamische tests in geïsoleerde containers. Bewaak uitgaand verkeer, syscalls en afwijkende uitvoer.

04

Ondertekenen & Registreren

HSM-ondersteunde ondertekening. ML-BOM-generatie. Registratie in het zakelijke AI-activaregister.

05

Gemonitorde inferentie

Toelatingscontroller + TEE + guardrail-laag + continue uitvoervalidatie.

AI-beveiliging + Software-toeleveringsketen = Eén probleem

AI-systemen worden gebouwd en geïmplementeerd via dezelfde CI/CD-pipelines die het doelwit zijn van aanvallen op de open-source toeleveringsketen. Als een model veilig is maar de Python-runtime is gecompromitteerd, is het systeem doorbroken. Als de container-image voor training is aangetast, zijn de gewichten onbetrouwbaar.

Elke scheiding tussen 'Software-activa' en 'AI-activa' is een gevaarlijke kloof die aanvallers zullen benutten.

Alleen-gewichten laden: Schakel uitvoerbare serialisatie uit. SafeTensors als standaardindeling.
Geïsoleerde runners: Gecontaineriseerde inferentie met minimale netwerktoegang en strikte uitgaande controles.
Mechanistische interpreteerbaarheid: Audit modelgewichten om latente achterdeur-triggers vóór implementatie te identificeren.
Geünificeerde herkomst: Model, dataset, OSS-afhankelijkheden en infrastructuur gelijktijdig beheerd en geverifieerd.
FAQ

Veelgestelde vragen

Waarom vormen AI-modelbestanden uit openbare repositories zoals Hugging Face een beveiligingsrisico?

Python's Pickle-serialisatie-indeling – gebruikt door PyTorch en scikit-learn – implementeert een stack-gebaseerde virtuele machine die willekeurige code kan uitvoeren tijdens deserialisatie. Door de __reduce__-methode te manipuleren, injecteren aanvallers reverse shells die activeren zodra een ontwikkelaar torch.load() uitvoert. JFrog-onderzoekers vonden meer dan 100 van dergelijke bewapende modellen op Hugging Face. Statische scanners zoals PickleScan hebben een percentage van 96% vals-positieven met 3 bekende zero-day bypasses, wat detectie onbetrouwbaar maakt.

Hoeveel vergiftigde documenten zijn er nodig om een groot taalmodel te compromitteren?

Slechts 250 vergiftigde documenten – wat slechts 0,00016% van het trainingscorpus vertegenwoordigt – kunnen een model met 13 miljard parameters permanent compromitteren. Zodra er tijdens de training ongeveer 50 trigger-voorkomens optreden, wordt de achterdeur permanent gecodeerd in de gewichtsruimte. Het achteraf toevoegen van miljoenen schone steekproeven overschrijft de aangeleerde trigger-respons-associatie niet. Deze 'slapende agenten' slagen voor alle standaardbenchmarks en activeren pas wanneer ze een specifieke trigger-token tegenkomen.

Wat is een ML Bill of Materials en waarom heeft enterprise-AI er een nodig?

Een ML-BOM (Machine Learning Bill of Materials) breidt traditionele SBOM's uit om modelherkomst, dataset-afstamming, trainingsmethodologie, framework-afhankelijkheden en cryptografische verklaringen vast te leggen – aangedreven door CycloneDX en SPDX 3.0 AI-profielen. Het maakt snelle kwetsbaarheidsreparatie mogelijk wanneer CVE's worden ontdekt in PyTorch of andere afhankelijkheden. In combinatie met HSM-ondersteunde cryptografische modelondertekening zorgt het ervoor dat alleen geautoriseerde modellen met geldige handtekeningen productie bereiken, terwijl de inferentie-engine weigert elk model met een ongeldige handtekening te laden.

Zijn uw modellen geverifieerd, of alleen gedownload?

Het verschil tussen 'vertrouwen op geluk' en verifieerbare weerbaarheid is een enkele architecturale beslissing.

Veriprajna ontwerpt de overgang van fragiele Shadow AI naar een cryptografisch beveiligde, hardware-ondersteunde Deep AI-stack – waardoor AI-implementatie voorspelbaar, controleerbaar en robuust wordt.

AI-beveiligingsbeoordeling

  • Audit van kwetsbaarheden in de ML-toeleveringsketen
  • Stappenplan voor ontdekking en herstel van Shadow AI
  • Risicobeoordeling van model-serialisatie-indelingen
  • NIST AI 100-2 compliance-gap-analyse

Deep AI Engineering

  • Ontwerp van private model-hub en ML-BOM-pipeline
  • Cryptografische modelondertekening met HSM-integratie
  • Implementatie van confidential computing voor gevoelige inferentie
  • Continue runtime-monitoring en guardrail-architectuur
Lees het volledige technische whitepaper

Volledig technisch rapport: taxonomie van serialisatie-aanvallen, AI Kill Chain-verdedigingen, ML-BOM-specificatie, cryptografische ondertekeningsarchitectuur, implementatiepatronen voor confidential computing, NIST AI 100-2 implementatiegids.

Social

Ook gepubliceerd op