Voor risico- en complianceverantwoordelijken4 min leestijd

Waarom drive-thru-spraak-AI faalt voor 80 miljoen stotterende mensen

Wendy's breidt spraak-AI uit naar 600 locaties, ondanks dat klanten drie pogingen nodig hebben om een burger te bestellen.

Het probleem

Klanten bij de drive-thrus van Wendy's herhalen hun bestelling drie of meer keer om een burger te krijgen. Het FreshAI-spreeksysteem van de keten — aangedreven door Google Cloud — breidt tegen het einde van 2025 uit naar 500 tot 600 locaties, ook al noemen gebruikers het "traag", "irritant" en vaak foutief. Klanten melden dat ze "MEDEWERKER" moeten schreeuwen om een mens te bereiken. De bot onderbreekt mensen halverwege de zin, stelt Frosty-smaken voor wanneer iemand naar thee vraagt, en heeft moeite met basisverzoeken zoals "geen augurk".

Maar de ernstigste fout treft een groep waar u misschien niet meteen aan denkt: mensen die stotteren. Stotteren treft wereldwijd meer dan 80 miljoen mensen. Voor hen wordt het systeem omschreven als "onbruikbaar". Wanneer iemand midden in een woord een stille blokkade ervaart, denkt de AI dat de persoon is uitgesproken en onderbreekt hem. Wanneer iemand een klank herhaalt — "b-b-b-baconator" — kan het systeem dit niet koppelen aan het juiste menu-item. Onderzoek toont aan dat sommige spraakherkenningsmodellen zulke verminkte resultaten opleveren dat ze een negatieve betekenisscore registreren. Dat betekent dat de AI de klant niet alleen verkeerd heeft verstaan; hij is elk begrip van wat er gezegd werd kwijtgeraakt.

Wendy's meldt een succespercentage van 86% voor bestellingen die zonder menselijke hulp worden afgehandeld. Dat klinkt indrukwekkend, totdat u beseft dat de resterende 14% een enorm foutpercentage vertegenwoordigt in een sector waar snelheid en nauwkeurigheid klantloyaliteit bepalen. Als uw bedrijf een systeem zou uitrollen dat bij één op de zeven klanten faalt, zou u dat dan klaar noemen voor een landelijke uitrol?

Waarom dit belangrijk is voor uw bedrijf

Dit is niet zomaar een fastfoodverhaal. Het is een voorproefje van wat er gebeurt wanneer een consumentgericht bedrijf AI opschaalt voordat het er klaar voor is. De financiële, juridische en reputatierisico's zijn reëel — en ze groeien snel.

Dit is wat de data laat zien:

  • 72% van de S&P 500-bedrijven merkt het falen van AI nu aan als een materieel risico in openbare publicaties, tegenover slechts 12% in 2023. Uw raad van bestuur kijkt mee.
  • 53% van de consumenten vreest dat hun persoonlijke gegevens worden misbruikt door AI-klantenservice. Vertrouwenserosie treft uw merk nog voordat u het terugziet in kwartaalcijfers.
  • Het achteraf aanpassen van een niet-conform AI-systeem op honderden locaties kan vijf keer meer kosten dan het vanaf het begin goed bouwen. Dat is het verschil tussen geplande investeringsuitgaven en een noodherstelbudget.

Ook de regelgeving sluit zich steeds nauwer. De Americans with Disabilities Act verbiedt al discriminatie in openbare ruimtes. Nieuwe normen zoals CAN-ASC-6.2:2025 — de eerste specifieke toegankelijkheidsnorm voor AI-systemen — vereisen nu dat mensen met een beperking worden betrokken bij het ontwerp, het testen en het beheer van uw AI. De European Accessibility Act wordt sinds juni 2025 gehandhaafd met hoge boetes.

Als uw AI klanten benadeelt vanwege trage of herhalende spraak, heeft u een toegankelijkheids- en biasrisico waar toezichthouders zich specifiek op richten. De vraag voor uw juridische en risicoteams is eenvoudig: kunt u aantonen dat uw AI elke klant gelijk behandelt, ongeacht hoe zij spreken?

Wat er onder de motorkap werkelijk gebeurt

Het kernprobleem is niet het "brein" van de AI — het zijn de "oren" van de AI. De meeste drive-thru AI-systemen gebruiken wat in de sector een "API-wrapper"-benadering wordt genoemd. Zie het als het vastmaken van een eenvoudige microfoon aan een genie dat kilometers verderop in een geluiddichte kamer zit. Het genie is slim, maar hoort slechts flarden van wat u zei, vermengd met motorgeluid en wind.

Het eerste faalpunt is Voice Activity Detection (VAD) — het systeem dat bepaalt wanneer u bent begonnen met praten en wanneer u bent gestopt. Eenvoudige VAD-systemen werken op basis van volumedrempels. Ze zijn ontworpen voor rustige ruimtes met goede microfoons. In een drive-thru kan een dieselmotor, een windvlaag of het dichtslaan van een autodeur ze misleiden.

Wanneer u een halve seconde pauzeert om op het menubord te kijken, interpreteert het systeem die stilte als "klaar met praten". Het pakt uw onvolledige zin en stuurt deze naar de cloud voor verwerking. Het resultaat komt verminkt terug. De bot reageert met iets irrelevants. U herhaalt uzelf. Dit gebeurt opnieuw. Drie pogingen later schreeuwt u om een menselijke medewerker.

De tweede fout is latentie. Elk gesproken woord moet van de drive-thru-microfoon via het openbare internet naar een datacentrum reizen en weer terug. Die retourreis alleen al kost 100 tot 500 milliseconden voordat de AI überhaupt begint met verwerken. De gouden standaard voor natuurlijke spraakinteractie is in totaal minder dan 300 milliseconden. Zodra u de 700-900 milliseconden overschrijdt, loopt het gesprek vast. Bij twee seconden voelt het als een slecht telefoongesprek waarbij mensen door elkaar heen praten.

Dit zijn geen cosmetische problemen. Het zijn architectonische zwaktes die met geen enkele hoeveelheid prompt engineering kunnen worden opgelost.

Wat werkt (en wat niet)

Drie veelvoorkomende benaderingen die in de echte wereld falen:

  • "Zet de microfoongevoeligheid gewoon hoger." Hierdoor wordt naast meer stem ook meer lawaai opgevangen. Uw AI hoort nu elk optrekkend motorgeluid en interpreteert dit als spraak. Het probleem wordt erger, niet beter.
  • "Verfijn het cloudmodel met meer data." Een Large Language Model voor algemene doeleinden hoeft geen poëzie te schrijven — het moet weten dat "Dave's Single" een burger is en geen albumtitel. Algemene modellen zijn voor specifieke taken trager en minder nauwkeurig dan speciaal gebouwde modellen.
  • "Voeg een langere pauze-time-out toe." Een statische time-out die voor iedereen twee seconden wacht, betekent dat uw snelsprekende klanten naar een zwijgende luidsprekerpaal staren. One-size-fits-all-instellingen creëren nieuwe frictie voor de meerderheid terwijl ze de minderheid nauwelijks helpen.

Wat wel werkt, is een drielaagse architectuur die problemen in elke fase oplost:

1. Slimme signaalverwerking bij de bron. In plaats van een eenvoudige volumedrempel kennen neurale VAD-modellen een waarschijnlijkheidsscore toe aan inkomend geluid. Ze kunnen het verschil onderscheiden tussen een menselijke stem en motorgeluiden. Ze maken gebruik van spectral gating — een ruisfiltertechniek — om ongeveer 75% van het achtergrondgeluid te verwijderen voordat de audio het apparaat verlaat. Het systeem begint ook met het verwerken van audio na 250 milliseconden, maar wacht tot 600 milliseconden op een bevestigd eindpunt. Dit verkort de ervaren vertraging met 350-600 milliseconden en voorkomt dat sprekers voortijdig worden afgekapt.

2. Lokale verwerking op edge-hardware. In plaats van elk woord naar een extern datacentrum te sturen, verwerkt u het op gespecialiseerde chips in het restaurant zelf. Dit verlaagt de latentie van 100-500 milliseconden naar 5-10 milliseconden. Uw systeem blijft zelfs werken tijdens internetstoringen. De spraakgegevens van uw klanten blijven op locatie, wat cruciaal is voor datasoevereiniteit en privacy. En u vervangt onvoorspelbare cloud-API-kosten door vaste hardwarekosten — doorgaans 30-40% lagere operationele kosten.

3. Contextbewuste sprekerswisseling en escalatie. Als een klant zegt: "Ik wil graag een Baconator en...", herkent het systeem dat het voegwoord "en" betekent dat de beurt nog niet voorbij is, zelfs als er een pauze van een seconde valt. Als een klant zegt: "dat is alles", reageert het systeem binnen 200 milliseconden. Voor mensen die stotteren is het systeem getraind op spraak met blokkades, verlengingen en herhalingen. Het verwart een stilte midden in een woord niet met het einde van een zin.

Het nalevingsvoordeel is hierbij cruciaal voor uw auditteams. Elke beslissing — waarom het systeem wachtte, waarom het escaleerde naar een mens, waarom het een bestelling op een bepaalde manier interpreteerde — is herleidbaar. U kunt toezichthouders precies laten zien hoe uw AI een specifieke interactie heeft afgehandeld. Tests voorafgaand aan de implementatie maken gebruik van diverse sprekersgroepen. Realtime guardrails vangen verboden taalgebruik of afwijkend gedrag op. Monitoring na de interactie signaleert foutpatronen voor continue verbetering. En automatische escalatie draagt complexe situaties over aan mensen voordat de klant gefrustreerd raakt.

Uw spraak-AI-systeem moet een controlespoor opleveren, geen mysterie.

Belangrijkste inzichten

  • Wendy's drive-thru-AI vereist drie of meer pogingen voor eenvoudige bestellingen en wordt als 'onbruikbaar' beschreven voor de 80 miljoen stotterende mensen wereldwijd.
  • 72% van de S&P 500-bedrijven rapporteert AI nu als een materieel risico — tegenover 12% in 2023 — waardoor mislukte AI-implementaties een bestuurskwestie worden.
  • Cloudgebaseerde spraak-AI voegt alleen al 100-500 ms netwerkvertraging toe; edge-verwerking verlaagt dat naar 5-10 ms en verlaagt de operationele kosten met 30-40%.
  • Nieuwe toegankelijkheidsnormen (CAN-ASC-6.2:2025 en de European Accessibility Act) eisen dat AI-systemen werken voor mensen met een beperking — met hoge boetes bij niet-naleving.
  • Het achteraf aanpassen van een niet-conform AI-systeem op honderden locaties kost tot vijf keer meer dan het vanaf het begin bouwen met een inclusief ontwerp.

Kort samengevat

Het opschalen van spraak-AI voordat het overweg kan met geluid in de echte wereld, diverse spraakpatronen en toegankelijkheidseisen creëert juridische, financiële en reputatierisico's die bij elke nieuwe locatie groter worden. De technologie bestaat om systemen te bouwen die elke klant begrijpen — niet alleen de makkelijke. Vraag uw AI-leverancier: kunt u mij de nauwkeurigheid van uw systeem laten zien uitgesplitst naar spraakonvloeiendheid, accent en achtergrondgeluid — en kunt u het besluitvormingsspoor voor elke escalatie overleggen?

FAQ

Veelgestelde vragen

Waarom laat Wendy's AI-drive-thru klanten hun bestelling herhalen?

De hoofdoorzaak is een zwakke Voice Activity Detection (VAD)-laag die korte pauzes — zoals het kijken op het menubord — verwart met het einde van een zin. Het stuurt onvolledige audio naar de cloud voor verwerking, wat verminkte resultaten oplevert. Klanten moeten zich dan herhalen, bij eenvoudige bestellingen vaak drie of meer keer.

Is bestellen via een AI-drive-thru toegankelijk voor mensen die stotteren?

Huidige systemen worden breed gerapporteerd als onbruikbaar voor mensen die stotteren. Wereldwijd stotteren ruim 80 miljoen mensen. Standaard spraakherkenningsmodellen zijn getraind op vloeiende spraak en interpreteren blokkades, verlengingen en herhalingen verkeerd. Sommige modellen leveren zelfs negatieve betekenisscores op — een totaal verlies van begrip.

Wat zijn de juridische risico's van AI die mensen met spraakbeperkingen uitsluit?

De ADA verbiedt discriminatie in openbare gelegenheden en nieuwe normen zoals CAN-ASC-6.2:2025 vereisen specifiek dat AI-systemen werken voor mensen met een beperking. De European Accessibility Act wordt sinds juni 2025 gehandhaafd met hoge boetes. Het achteraf aanpassen van een niet-conform systeem op vele locaties kan vijf keer meer kosten dan het vanaf het begin inclusief ontwerpen.

Bouw uw AI met vertrouwen.

Werk samen met een team met diepgaande ervaring in het bouwen van de volgende generatie enterprise-AI. Laat ons u helpen bij het ontwerpen, bouwen en implementeren van een AI-strategie waarop u kunt vertrouwen.

Veriprajna Deep Tech-adviesbureau is gespecialiseerd in het bouwen van veiligheidskritische AI-systemen voor de gezondheidszorg, de financiële sector en gereguleerde domeinen. Onze architecturen worden gevalideerd aan de hand van gevestigde protocollen met uitgebreide compliancedocumentatie.