Voor risico- en complianceverantwoordelijken4 min leestijd

AI-nauwkeurigheidsclaims in de zorg: wat 0,001% werkelijk betekent

Texas dwong een AI-leverancier toe te geven dat zijn hallucinatiepercentage een marketingfantasie was — nadat vier ziekenhuizen de software al hadden geïmplementeerd.

Het probleem

In september 2024 dwong de procureur-generaal van Texas een AI-bedrijf in de gezondheidszorg genaamd Pieces Technologies tot een baanbrekende schikking. Het bedrijf had ziekenhuizen verteld dat zijn klinische documentatiesoftware een "kritiek hallucinatiepercentage" had van minder dan 0,001% — minder dan één fout per 100.000 outputs. De staat noemde die claim zowel onjuist als misleidend.

Hier is het deel waar u 's nachts van wakker zou moeten liggen. Vier grote Texaanse ziekenhuizen hadden deze software al geïmplementeerd. Houston Methodist, Children's Health System of Texas, Texas Health Resources en Parkland Hospital gebruikten het allemaal. De AI vatte patiëntendossiers samen, stelde klinische notities op en hield belemmeringen voor ontslag bij. Dit zijn geen taken met een laag risico. Fouten in klinische documentatie kunnen de patiëntveiligheid rechtstreeks beïnvloeden.

De procureur-generaal van Texas had geen nieuwe AI-wetgeving nodig om op te treden. Bestaande regels voor consumentenbescherming — de Texas Deceptive Trade Practices–Consumer Protection Act — waren voldoende. De staat concludeerde dat de nauwkeurigheidsmetrieken die Pieces Technologies vermarktte "waarschijnlijk onnauwkeurig" en potentieel misleidend waren. Uw organisatie hoeft niet in de gezondheidszorg actief te zijn om de gevolgen te voelen. Als u AI inzet en beweringen doet over de nauwkeurigheid ervan, heeft de procureur-generaal van uw staat al de instrumenten in handen om een onderzoek naar u in te stellen.

Deze zaak draait niet alleen om één bedrijf. Het is een waarschuwingsschot voor elke onderneming die AI-systemen koopt of bouwt die van invloed zijn op gereguleerde besluitvorming.

Waarom dit belangrijk is voor uw organisatie

De financiële en juridische risico's van ongeverifieerde AI-claims zijn niet langer theoretisch. De schikking van Pieces Technologies creëerde een vijfjarige complianceverplichting met de staat Texas. Dat betekent vijf jaar van verplichte openbaarmakingen, continue monitoring en de mogelijkheid van onafhankelijke audits door derden. Bedenk wat voor impact een dergelijk toezicht op uw bedrijfsvoering zou hebben.

De cijfers schetsen een ontluisterend beeld in de hele sector:

  • Slechts 5% van de bedrijven behaalt meetbare bedrijfswaarde uit AI op schaal. De overige 95% doet uitgaven zonder duidelijk rendement.
  • 65% van de ontwikkelaars meldt dat AI "relevante context verliest" tijdens complexe taken, wat leidt tot subtiele fouten of inconsistenties.
  • Bedrijven die gespecialiseerde AI-tools aanschaffen van leveranciers hebben een slagingspercentage van 67%, terwijl bedrijven die interne tools vanaf nul opbouwen slechts in 33% van de gevallen slagen.

De schikking verplicht Pieces Technologies nu om de specifieke data en modellen openbaar te maken die zijn gebruikt om zijn producten te trainen. Ook eist het openbaarmaking van de methodologie achter eventuele prestatiemetrieken. Als uw AI-leverancier u niet kan aantonen hoe zijn nauwkeurigheidsclaims zijn berekend, deelt u in diens risico.

Voor uw raad van bestuur en uw complianceteam is de les helder. De toezichtsstandaard is niet "werkte de AI het grootste deel van de tijd". De standaard is: kunt u het bewijzen, en heeft u uw klanten de waarheid verteld over hoe u het heeft gemeten? Als uw organisatie AI inzet in een gereguleerde functie — klinisch, financieel of juridisch —, dan is deze schikking uw nieuwe uitgangspunt voor due diligence.

Wat er werkelijk onder de motorkap gebeurt

Om te begrijpen waarom een hallucinatieclaim van 0,001% zo verdacht is, moet u weten hoe deze AI-systemen daadwerkelijk werken.

Large Language Models — de technologie achter tools zoals GPT-4 — zijn voorspellingsmotoren. Ze genereren tekst door het meest waarschijnlijke volgende woord te raden op basis van patronen die tijdens de training zijn geleerd. Zie het als automatisch aanvullen op uw telefoon, maar dan opgeschaald om hele alinea's te schrijven. Het systeem "begrijpt" geen feiten. Het voorspelt wat aannemelijk klinkt.

Een hallucinatie doet zich voor wanneer de AI een hoge waarschijnlijkheid toekent aan een woord of zinsnede die correct klinkt, maar feitelijk onjuist is. In een klinische setting kan dit betekenen dat er een medicatienaam wordt gegenereerd die past binnen de zinsstructuur, maar niet overeenkomt met het daadwerkelijke patiëntendossier.

Het meten van deze fouten met een precisie van 0,001% zou een enorme, perfect gelabelde dataset van klinische samenvattingen vereisen. Die dataset bestaat niet. Klinische documentatie is te gefragmenteerd en te specifiek voor individuele patiënten en artsen voor een universele gouden standaard.

Dit is het kernprobleem van wat het witboek het "wrapper-model" noemt. Een wrapper stuurt uw gegevens via een API naar een algemene AI en toont wat er terugkomt. Het voegt minimale domeinspecifieke controles toe. Deze aanpak brengt producten snel op de markt, maar ontbeert de technische waarborgen die nodig zijn om hallucinaties op te vangen, datalekken te voorkomen of weerstand te bieden aan prompt injection-aanvallen. Een eenvoudige API-aanroep naar een algemeen model kan geen rekening houden met de volledige medische voorgeschiedenis van een patiënt of de specifieke documentatiestijl van een arts. Snelle marktintroductie is niet hetzelfde als veiligheid in de praktijk.

Wat werkt (en wat niet)

Laten we eerst de benaderingen opruimen die een vals gevoel van veiligheid geven:

  • Uitsluitend vertrouwen op door leveranciers gerapporteerde nauwkeurigheidsmetrieken. De Texaanse zaak heeft bewezen dat deze benchmarks de strengheid en onafhankelijkheid kunnen missen die vereist zijn voor validatie op enterpriseprecisie. Uw inkoopteam heeft onafhankelijk bewijs nodig.
  • Erop vertrouwen dat een enkel AI-model zichzelf controleert. Een algemeen model dat zijn eigen generieke veiligheidsmechanismen toepast, volstaat niet voor risicovolle klinische of financiële beslissingen.
  • AI-pilots opschalen zonder een datakwaliteitsstrategie. Onderzoek toont aan dat toonaangevende bedrijven een "70:20:10"-regel volgen: 70% van de implementatie-inspanning gaat naar organisatorische transformatie, 20% naar de technologiestack en slechts 10% naar het algoritme. De meeste achterblijvers schalen modellen op met rommelige of gescheiden opgeslagen data.

Dit is wat wél werkt — een driestappenaanpak gebaseerd op verifieerbare resultaten:

1. Veranker elke AI-reactie in uw daadwerkelijke data. Retrieval-Augmented Generation (RAG) — een methode waarbij de AI uw echte brondocumenten ophaalt en raadpleegt voordat een antwoord wordt gegenereerd — zorgt ervoor dat de output gekoppeld blijft aan feiten die u beheert. In plaats van de AI te laten gokken op basis van zijn trainingsdata, voedt u het systeem met het daadwerkelijke patiëntendossier, contract of beleidsdocument. Deze aanpak verbetert het behoud van context via realtime data-ophaling en langdurige vectoropslag.

2. Voeg een adversariële detectielaag toe. Dit betekent dat er een tweede AI-systeem wordt ingezet waarvan de enige taak is om het werk van het eerste systeem te controleren. In de architectuur van Pieces Technologies was hun detectiemodule 7,5 keer effectiever in het opsporen van klinisch significante hallucinaties dan aselecte steekproeven. Het principe blijft gelden, zelfs als het totale percentage werd betwist: geautomatiseerde controle vangt fouten op die mensen over het hoofd zien.

3. Behoud menselijke controle (human-in-the-loop) bij beslissingen met een hoog risico. AI moet opstellen, niet beslissen. Bij Pieces werden samenvattingen die door hun detectiesysteem waren gemarkeerd, ter beoordeling voorgelegd aan gecertificeerde artsen. De mediane tijd om een gemarkeerde fout te corrigeren was 3,7 uur. In een acute zorgomgeving volstaat een dergelijke vertraging voor voortgangsnotities, maar kan deze gevaarlijk zijn voor realtime besluitvormingsondersteuning. U moet uw AI-use-cases indelen naar risiconiveau en vereiste responssnelheid.

Het audittrail-voordeel brengt dit samen voor uw compliance- en juridische teams. Kaders zoals FAIR-AI bevelen aan om voor elke ingezette tool een "AI-label" op te stellen. Dit label onthult de trainingsdata, de modelversie en bekende foutmodi aan de eindgebruiker. Wanneer een toezichthouder of auditor vraagt hoe uw AI tot een specifieke beslissing is gekomen, kunt u precies laten zien welke brondocumenten zijn geraadpleegd, welke controles zijn doorstaan en welke menselijke expert de uiteindelijke output heeft goedgekeurd. Die transparantie is wat een verdedigbare implementatie onderscheidt van een aansprakelijkheid.

Voor organisaties in de gezondheidszorg en biowetenschappen, is dit type grounding en bronverificatie niet optioneel — het is de opkomende standaard. Een GraphRAG-architectuur die uw AI verbindt met gestructureerde kennisgrafen en gevalideerde brondossiers, vormt het technische fundament dat dit mogelijk maakt.

U kunt de volledige technische analyse lezen of de interactieve versie verkennen voor de gedetailleerde techniek achter deze aanbevelingen.

Belangrijkste inzichten

  • Texas gebruikte bestaande consumentenbeschermingswetgeving — geen nieuwe AI-regelgeving — om een AI-zorgleverancier te dwingen tot een vijfjarige complianceschikking wegens misleidende nauwkeurigheidsclaims.
  • Slechts 5% van de bedrijven behaalt meetbare bedrijfswaarde uit AI op schaal; 70% van de succesvolle implementatie-inspanning gaat naar organisatorische verandering, niet naar het algoritme.
  • Een claim van een hallucinatiepercentage van 0,001% vereist een perfect geannoteerde gouden-standaarddataset die voor klinische documentatie simpelweg niet bestaat.
  • Adversariële detectiemodules — een tweede AI die de eerste controleert — zijn 7,5 keer effectiever in het opsporen van klinisch significante hallucinaties dan aselecte steekproeven.
  • Elke ingezette AI-tool zou een 'AI-label' moeten hebben dat trainingsdata, modelversie en bekende foutmodi bekendmaakt aan eindgebruikers en auditors.

Kort samengevat

De Texaanse schikking bewijst dat de procureur-generaal van uw staat geen nieuwe AI-wetgeving nodig heeft om uw organisatie aansprakelijk te stellen voor ongeverifieerde nauwkeurigheidsclaims. Als uw AI gereguleerde besluitvorming raakt, heeft u verifieerbare resultaten nodig die zijn verankerd in uw eigen data, adversariële controlelagen en menselijk toezicht gedifferentieerd naar risico. Vraag uw AI-leverancier: kunt u ons precies laten zien hoe u uw nauwkeurigheidspercentage heeft berekend, welke dataset u heeft gebruikt en stemt u in met een onafhankelijke audit door derden?

FAQ

Veelgestelde vragen

Kan AI worden vertrouwd voor documentatie in de gezondheidszorg?

AI kan ondersteunen bij zorgdocumentatie, maar alleen met de juiste waarborgen. De schikking van de procureur-generaal van Texas met Pieces Technologies toonde aan dat nauwkeurigheidsclaims zoals een hallucinatiepercentage van 0,001% misleidend kunnen zijn. Betrouwbare systemen vereisen retrieval-augmented generation om resultaten te verankeren in daadwerkelijke patiëntendossiers, adversariële detectielagen en menselijke controle bij risicovolle uitkomsten.

Wat gebeurde er bij de Texaanse AI-zorgschikking?

In september 2024 trof de procureur-generaal van Texas een schikking met Pieces Technologies, een zorg-AI-bedrijf dat een kritiek hallucinatiepercentage onder 0,001% claimde. De staat stelde dat deze metriek onnauwkeurig en misleidend was. Vier grote Texaanse ziekenhuizen hadden de software geïmplementeerd. De schikking vereist vijf jaar transparantie over metrieken, risico-openbaarmakingen en documentatie van trainingsdata.

Hoe verifieert u nauwkeurigheidsclaims van AI-leveranciers?

Vraag leveranciers om precies openbaar te maken hoe zij hun nauwkeurigheidsmetrieken hebben berekend, welke datasets zijn gebruikt en of zij akkoord gaan met onafhankelijke audits door derden. De Texaanse schikking verplicht AI-bedrijven nu om definities en berekeningsmethoden voor alle nauwkeurigheidsbenchmarks openbaar te maken. Kaders zoals FAIR-AI bevelen aan om een AI-label op te stellen dat trainingsdata, modelversie en bekende foutmodi onthult.

Bouw uw AI met vertrouwen.

Werk samen met een team met diepgaande ervaring in het bouwen van de volgende generatie enterprise-AI. Laat ons u helpen bij het ontwerpen, bouwen en implementeren van een AI-strategie waarop u kunt vertrouwen.

Veriprajna Deep Tech-adviesbureau is gespecialiseerd in het bouwen van veiligheidskritische AI-systemen voor de gezondheidszorg, de financiële sector en gereguleerde domeinen. Onze architecturen worden gevalideerd aan de hand van gevestigde protocollen met uitgebreide compliancedocumentatie.