
Ik bouwde een klinische AI-controle die een ware zin tegenhoudt
In een synthetisch patiëntenportaalconcept trof ik een correcte HbA1c-waarde van 6.8% aan naast het advies om door te gaan met metformine. Ditzelfde synthetische patiëntendossier toont een eGFR van 28. Toen ik die feiten samenbracht, ging het er niet langer om of de AI een laboratoriumuitslag kon citeren. De vraag werd of een feitelijk juiste zin geloofwaardigheid kan verlenen aan een handeling die de beoordeling van een arts vereist.
Ik heb de interactieve walkthrough van ChartSieve opgebouwd rond dat spanningsveld. Dit is een demonstratie op basis van vaste synthetische dossiers en gesimuleerde AI-uitvoer, geen klinische ingebruikname. Het stelt me in staat een inspectietraject helder te tonen: een conceptbericht arriveert, de claims worden onderbouwd, de aanbevolen handeling wordt getoetst aan het dossier, en een deterministische beleidsgate bepaalt of het bericht kan worden vrijgegeven, vastgehouden of geblokkeerd. Er wordt geen bericht naar een patiënt gestuurd.
De zin die mijn eerste vraag doorstond
Ik doorloop het patiëntenportaalconcept claim voor claim. De HbA1c-waarde van 6.8% komt overeen met het synthetische dossier. Metformine staat op de medicatielijst. Ik kan bij elk feit een bron plaatsen en op basis van die twee overeenkomsten alleen nog altijd geen reden hebben om het concept tegen te houden. De slotinstructie draagt de patiënt op door te gaan met het medicijn. Bij dat werkwoord aarzel ik. Een bron die de aanwezigheid van een medicijn bevestigt, kan de aanbeveling om ermee door te gaan niet autoriseren.
Ik verleg de aandacht van de onderbouwde zinnen naar de recentste nierfunctiewaarde, een eGFR van 28. Hier grijpt de voorgeprogrammeerde CONTRAINDICATION_RENAL-regel in en houdt het concept vast voor beoordeling door een arts. Dat is de ontwerpkeuze die ik in ChartSieve heb gemaakt: aanbevolen acties afzonderlijk van onderbouwde claims controleren, en vervolgens beide resultaten zichtbaar houden. Ik herlabel de HbA1c-waarde niet als onjuist om de hold eenvoudiger verklaarbaar te maken. De laboratoriumclaim blijft correct op het scherm staan, terwijl de aanbeveling een ander oordeel krijgt.
Ik laat ook het creatinineverloop zichtbaar: van 1.4 naar 1.9 en vervolgens 2.3 mg/dL. Dit biedt context bij de nierbevinding, maar vormt geen onafhankelijke trigger voor de beslissing. Ik bewaak dat onderscheid zorgvuldig, omdat het verleidelijk zou zijn om een alarmerende trend in de plaats te stellen van de feitelijke regel. De recentste eGFR stuurt de regelbevinding aan in deze synthetische casus. Een beoordelaar moet precies die bewijslast en regel kunnen betwisten die de hold hebben veroorzaakt, niet mijn interpretatie van een zorgwekkende grafiek.
Als ik naar het casusscherm kijk, schuilt het waardevolle detail niet louter in een rood label. De oorspronkelijke zin blijft zichtbaar naast de beslissing en de bevinding. Ik kan het concept, de HbA1c-claim en de renale reden voor het tegenhouden in één oogopslag overzien. Dat is het verschil tussen een generieke waarschuwing en een controleerbare beslissing. Een arts zou nog altijd de reële context moeten beoordelen; deze demo vervangt dat oordeel niet en bevestigt niet dat een behandelaar heeft gehandeld.

De onderbouwde claim en de vastgehouden handeling
Ik kan in het onveranderlijke synthetische dossier direct wijzen naar eGFR 28, waardoor de voorgeprogrammeerde hold helder onderbouwd is. Een productieregel zou echter eerst moeten bepalen welke nieruitslag moet worden gebruikt. Wat als twee uitslagen tegenstrijdig zijn, de nieuwste waarde ontbreekt of het betreffende zorgcontact onduidelijk is? ChartSieve lost die vragen niet op. Het selecteren van de dossierwaarde is op zichzelf een veiligheidsbeslissing. Een regel kan in de code uiterst nauwkeurig zijn geformuleerd, terwijl de ingevoerde gegevens onvolledig of betwistbaar zijn.
Ik zou willen dat die selectie ook aan de beoordelaar wordt getoond. Het gekozen resultaat, het tijdstip daarvan en eventueel ontbrekende context moeten zichtbaar zijn voordat iemand op de hold reageert. Anders kan een scherp gedefinieerde regel verzanden in een discussie over een verborgen invoerwaarde, en moet degene die het concept beoordeelt het dossieronderzoek van voren af aan herhalen.
Ik heb ervoor gekozen om de creatininegeschiedenis naast de recentste eGFR te tonen, zodat een beoordelaar de context ziet zonder deze te verwarren met de feitelijke trigger. Dat onderscheid moet ook overeind blijven bij het onderhoud van regels. Wie beheert de nierregel, welke klinische richtlijnen en lokale protocollen sturen deze aan, en hoe wordt een wijziging getest voordat deze concepten beïnvloedt? De demo hanteert een samengestelde set initiële regels. Het biedt geen onderhouden klinische kennisbank of een procedure om die eigenaarschapskwesties te beantwoorden.
Ik heb het casuspaneel zo ingericht dat een meningsverschil precies gelokaliseerd kan worden. De medicatielijst bevestigt dat de patiënt metformine gebruikt. De afzonderlijke CONTRAINDICATION_RENAL-regel houdt de aanbeveling om hiermee door te gaan tegen in het licht van eGFR 28. Een beoordelaar kan de bronselectie, de regel of de interpretatie van het voorschrift aanvechten, zonder te hoeven doen alsof de HbA1c-claim onjuist was. Dat zijn verschillende soorten meningsverschillen, en een reële workflow zou moeten kunnen registreren welke zich heeft voorgedaan.
Ik zou een behandelteam vragen wat er vervolgens moet gebeuren als een arts het oneens is met de hold. Welke motivering moet worden vastgelegd? Wie mag het conceptbericht vrijgeven en welk bewijs moet worden bewaard? De demo markeert inhoud voor beoordeling, maar koppelt die toestand niet aan een clinicus en documenteert geen handmatige overschrijving (override). Precies op die onvoltooide overdracht moet een zorginstelling verantwoordelijkheden vastleggen. Een scherm met de melding «held» kan mij niet vertellen wie het advies aan de patiënt uiteindelijk heeft geaccepteerd, herzien of afgewezen.
Ik wilde dat de hold inspecteerbaar was
Ik wilde niet dat een beoordelaar uitsluitend het oordeel van een model zou ontvangen dat het concept er riskant uitzag. In de demonstratie kunnen verificatie-agents adviezen toevoegen over bronverankering, billijkheid en red-teaming. Een live provider is optioneel en reacties kunnen worden gecachet; zonder provider wordt deterministische adviestekst benut. Die adviezen kunnen het inzicht van een beoordelaar verrijken, maar bepalen of doorkruisen de uiteindelijke beslissing niet. De deterministische beleidsgate retourneert RELEASE, HOLD_FOR_REVIEW, of BLOCK.
Die grens is in deze casus doorslaggevend. Zelfs als een advies welbespraakt is, blijft het concept in de gesimuleerde workflow vastgehouden als de regelbevinding een hold voorschrijft. Als een advies ontbreekt of weinig overtuigend is, kan dezelfde regel nog steeds worden geëvalueerd. Het gezag van de gate is expliciet, in plaats van verstopt te zitten in een overtuigende alinea van een ander model. Ik kan het oneens zijn met het ontwerp van een initiële regel en toch precies weten welk deel van het systeem de beslissing heeft genomen. Dat is voor governance aanzienlijk waardevoller dan een enkele, ondoorzichtige betrouwbaarheidsscore.
Het Veiligheidsbewijs (Safety Receipt) biedt me een andere manier om de hold te ontleden. Voor de metforminecasus bevat het demorecord het eindoordeel, beschikbare bronnen voor de claims, de nierbevinding, adviezen, een tijdstempel en een SHA-256-digest weergegeven als 16 hexadecimale tekens. Ik kan nagaan welk bewijs bij het besluit hoorde. De digest is afgekapt in het getoonde bewijs; een integriteits- en bewaarbeleid voor productieomgevingen zou meer vereisen dan deze registratie. De zichtbare velden maken deze voorgeprogrammeerde beslissing inspecteerbaar.

Ik lees dat bewijs achterwaarts, beginnend bij het hold-oordeel. Eerst zoek ik naar de regelbevinding die de hold veroorzaakte; vervolgens zoek ik naar de claimbronnen die geldig zijn gebleven. Die volgorde voorkomt dat ik het eindoordeel beschouw als een afwijzing van elke afzonderlijke zin in het concept. Het biedt een beoordelaar bovendien een concreet aangrijpingspunt voor bezwaar. Men kan de initiële regel, de geselecteerde nierwaarde of de interpretatie van het medicatievoorschrift aanvechten. Dat zijn verschillende bezwaren, en het bewijs houdt de relevante velden dicht genoeg bij elkaar om ze uit elkaar te houden. Een enkel risicolabel zou de beoordelaar dwingen die hele keten zelf te reconstrueren.
Ik vermijd het ook om het verhaal zo voor te stellen alsof het vastgehouden concept al door een arts is beoordeeld. De interface markeert het slechts ter beoordeling; het documenteert geen feitelijke handeling van het zorgteam. Dat klinkt wellicht als een klein semantisch verschil, totdat een bewering als «beoordeeld door arts» in een patiëntendossier of auditverslag belandt. Een veiligheidsworkflow moet exact registreren wat daadwerkelijk heeft plaatsgevonden en wat louter in behandeling is. De waarde van het bewijs in deze demo is dat het de gesimuleerde beslissing en het bijbehorende bewijsmateriaal inspecteerbaar maakt, niet dat het een werkelijke klinische overdracht bewijst.
De baseline die me deed stilstaan
Ik keer terug naar het metformineconcept wanneer ik naar de benchmark kijk. Als ik alleen de vermelde laboratoriumwaarde inspecteer, komt de 6.8% overeen met het dossier. Als ik de aanbevolen handeling afzet tegen de recentste nierwaarde, triggert eGFR 28 de voorgeprogrammeerde hold. Ik wilde dat de regressieset die verschuiving in vraagstelling zichtbaar maakte voorbij één enkel scherm, met behoud van oprechtheid over hoe beperkt en synthetisch de test is.
Deze bevat 34 vaste, synthetisch gelabelde artefacten: 12 gemarkeerd als veilig en 22 als onveilig. De deterministische firewall van ChartSieve hield alle 22 onveilige artefacten tegen of blokkeerde deze, en liet de 12 veilige ongemoeid. De gedefinieerde vergelijkingsbaseline toetst genoemde laboratoriumwaarden aan het dossier en geeft op basis daarvan klinische beslisondersteuning vrij. Deze detecteerde 4 van de 22 onveilige artefacten en miste er 18. Een labwaarde-matcher beantwoordt een beperktere vraag dan deze voorgeprogrammeerde regelcontrole. Het metforminescherm toont waarom: het juiste getal en de door de regel tegengehouden instructie staan in hetzelfde conceptbericht.

Ik moet nog altijd weten wie de regeldefinities beoordeelt, hoe meningsverschillen worden vastgelegd, welke fouten de gelabelde set uitsluit en wat er gebeurt als bewijsmateriaal voor een regel ontbreekt. De demo geeft die vraagstukken een concreet object: een inspecteerbaar concept, een synthetisch dossier, een regelbevinding en een besluit. De 18 missers in de laboratoriummatching-baseline tonen wat de bredere veiligheidscontroles toevoegen aan deze vaste set; ze kunnen me niet vertellen hoe het systeem zou presteren op nieuwe klinische casussen. De voorbeelden zijn voorzien van bekende patronen, en de baseline is een doelbewust beperkte vergelijking, geen commercieel product van een derde partij.
Wat ik aan een zorgteam zou voorleggen
Ik zou een gesprek beginnen met het metforminescherm, niet de scorekaart. Het geeft een leider in de klinische informatica iets specifieks om te bevragen. Is de recentste eGFR de juiste trigger in een onderhouden regel? Welke uitzonderingen en ontbrekende gegevens doen ter zake? Wat moet de beoordelaar zien en wat moet het systeem vastleggen als een hold wordt overschreven? Dat zijn beslissingen voor klinische governance, niet voor een marketingalinea of een ongecontroleerde modelreactie.
En als u het liever in actie ziet dan mijn beschrijving te lezen, vindt u hier het hele systeem van begin tot eind draaiend.
De volledige analyse van de demonstratie rond klinische AI-veiligheid toont de casus en het inspectietraject. Ik keer terug naar één beeld daarin: een correcte laboratoriumwaarde naast een vastgehouden medicatie-instructie. Beide feiten verdienen het om zichtbaar te blijven. Het verbergen van de juiste claim zou het concept overduidelijk gebrekkig doen lijken; het weglaten van de nierbevinding zou het verzendklaar doen schijnen. Het wezenlijke werk begint wanneer de interface beide op het scherm handhaaft en iemand vraagt verantwoording af te leggen voor de handeling ertussenin.



