Pour les responsables risque et conformité4 min de lecture

Pourquoi l'IA de drive-thru échoue pour 80 millions de personnes qui bégaient

Wendy's étend son IA vocale à 600 établissements alors que les clients doivent s'y reprendre trois fois pour commander un burger.

Le problème

Les clients des drive-thrus de Wendy's répètent leur commande trois fois ou plus simplement pour obtenir un burger. Le système vocal FreshAI de la chaîne — alimenté par Google Cloud — s'étend à 500-600 établissements d'ici la fin 2025, alors même que les utilisateurs le qualifient de « lent », « agaçant » et souvent erroné. Des clients disent crier « AGENT » juste pour joindre un être humain. Le robot les interrompt en pleine phrase, suggère des parfums de Frosty quand quelqu'un demande du thé et peine avec des demandes élémentaires comme « sans cornichon ».

Mais la pire défaillance touche un groupe auquel vous ne pensez peut-être pas immédiatement : les personnes qui bégaient. Le bégaiement touche plus de 80 millions de personnes dans le monde. Pour elles, le système est décrit comme « inutilisable ». Lorsqu'une personne subit un blocage silencieux au milieu d'un mot, l'IA pense qu'elle a fini de parler et l'interrompt. Lorsqu'une personne répète un son — « b-b-b-baconator » — le système ne peut pas l'associer au bon article du menu. Des recherches montrent que certains modèles de reconnaissance vocale renvoient des résultats si déformés qu'ils obtiennent un score de sens négatif. Cela signifie que l'IA ne s'est pas contentée de mal entendre le client. Elle a perdu toute compréhension de ce qu'il disait.

Wendy's indique un taux de réussite de 86% pour les commandes traitées sans aide humaine. Cela paraît solide jusqu'à ce que vous réalisiez que les 14% restants représentent un taux d'échec massif dans un secteur où la rapidité et la précision déterminent la fidélité. Si votre entreprise déployait un système qui échouait auprès d'un client sur sept, le jugeriez-vous prêt pour un déploiement national ?

Pourquoi cela compte pour votre entreprise

Ce n'est pas seulement une histoire de restauration rapide. C'est un aperçu de ce qui se produit lorsqu'une entreprise en contact avec les consommateurs déploie l'IA à grande échelle avant qu'elle ne soit prête. Les risques financiers, juridiques et réputationnels sont réels — et ils augmentent rapidement.

Voici ce que montrent les données :

  • 72% des entreprises du S&P 500 signalent désormais l'échec de l'IA comme un risque important dans leurs informations publiques, contre seulement 12% en 2023. Votre conseil d'administration surveille la situation.
  • 53% des consommateurs craignent que leurs données personnelles soient utilisées à mauvais escient par le service client IA. L'érosion de la confiance frappe votre marque avant d'apparaître dans vos chiffres trimestriels.
  • La mise en conformité a posteriori d'un système d'IA non conforme dans des centaines d'établissements peut coûter cinq fois plus cher que de le concevoir correctement dès le départ. C'est la différence entre une dépense d'investissement planifiée et un budget de remédiation d'urgence.

Les contraintes réglementaires se resserrent également. L'Americans with Disabilities Act interdit déjà la discrimination dans les lieux publics. De nouvelles normes telles que CAN-ASC-6.2:2025 — la première norme d'accessibilité dédiée aux systèmes d'IA — exigent désormais que les personnes handicapées participent à la conception, aux tests et à la gouvernance de votre IA. L'European Accessibility Act a commencé à être appliqué en juin 2025, avec de lourdes amendes.

Si votre IA pénalise les clients dont la parole est lente ou répétitive, vous vous exposez à des risques d'accessibilité et de biais que les régulateurs ciblent précisément. La question pour vos équipes juridiques et de gestion des risques est simple : pouvez-vous prouver que votre IA traite chaque client de manière égale, quelle que soit sa façon de parler ?

Ce qui se passe réellement sous le capot

Le problème central n'est pas le « cerveau » de l'IA — ce sont ses « oreilles ». La plupart des systèmes d'IA pour drive-thru utilisent ce que le secteur appelle une approche d'« enveloppe d'API ». Imaginez que l'on attache un microphone rudimentaire à un génie assis à des kilomètres de là dans une pièce insonorisée. Le génie est intelligent, mais il n'entend que des fragments de ce que vous avez dit, mêlés au bruit du moteur et au vent.

Le premier point de défaillance est la détection d'activité vocale (VAD) — le système qui détermine quand vous avez commencé à parler et quand vous avez arrêté. Les systèmes VAD de base fonctionnent avec des seuils de volume. Ils ont été conçus pour des pièces calmes dotées de bons microphones. Dans un drive-thru, un moteur diesel, une rafale de vent ou le claquement d'une portière peuvent les tromper.

Lorsque vous vous interrompez une demi-seconde pour regarder le panneau du menu, le système interprète ce silence comme « a fini de parler ». Il saisit votre phrase incomplète et l'envoie dans le cloud pour traitement. Le résultat revient déformé. Le robot répond par quelque chose de hors sujet. Vous vous répétez. Cela se reproduit. Trois tentatives plus tard, vous criez pour obtenir un humain.

La deuxième défaillance est la latence. Chaque mot prononcé doit parcourir le trajet depuis le microphone du drive-thru, via l'Internet public jusqu'à un centre de données, puis revenir. Ce seul aller-retour consomme de 100 à 500 millisecondes avant même que l'IA commence le traitement. La référence pour une interaction vocale naturelle est un total inférieur à 300 millisecondes. Dès que vous dépassez 700-900 millisecondes, la conversation se désagrège. À deux secondes, cela ressemble à un mauvais appel téléphonique où les gens parlent les uns sur les autres.

Ce ne sont pas des problèmes cosmétiques. Ce sont des faiblesses architecturales qu'aucune quantité d'ingénierie des prompts ne peut corriger.

Ce qui fonctionne (et ce qui ne fonctionne pas)

Trois approches courantes qui échouent dans le monde réel :

  • « Augmentez simplement la sensibilité du microphone. » Cela capte davantage de bruit en même temps que davantage de voix. Votre IA entend désormais chaque accélération de moteur et l'interprète comme de la parole. Le problème s'aggrave, il ne s'améliore pas.
  • « Affinez le modèle cloud avec davantage de données. » Un grand modèle de langage généraliste n'a pas besoin d'écrire de la poésie — il doit savoir que « Dave's Single » est un burger, et non le titre d'un album. Les modèles généralistes sont plus lents et moins précis pour des tâches spécifiques que les modèles conçus à cet effet.
  • « Ajoutez un délai d'attente de pause plus long. » Un délai statique qui attend deux secondes pour tout le monde signifie que vos clients qui parlent vite fixent un boîtier de haut-parleur silencieux. Des réglages uniformes créent de nouvelles frictions pour la majorité tout en aidant à peine la minorité.

Ce qui fonctionne réellement est une architecture à trois couches qui résout les problèmes à chaque étape :

1. Traitement intelligent du signal à la source. Au lieu d'un simple seuil de volume, les modèles VAD neuronaux attribuent un score de probabilité au son entrant. Ils peuvent distinguer une voix humaine d'un bruit transitoire de moteur. Ils utilisent le filtrage spectral — une technique de filtrage du bruit — pour éliminer environ 75% du bruit de fond avant même que l'audio quitte l'appareil. Le système commence également à traiter l'audio à 250 millisecondes, mais attend jusqu'à 600 millisecondes une fin confirmée. Cela réduit le délai perçu de 350-600 millisecondes tout en empêchant les coupures prématurées.

2. Traitement local sur du matériel edge. Au lieu d'envoyer chaque mot vers un centre de données éloigné, vous le traitez sur des puces spécialisées dans le restaurant même. Cela fait passer la latence de 100-500 millisecondes à 5-10 millisecondes. Votre système fonctionne même pendant les pannes d'Internet. Les données vocales de vos clients restent sur site, ce qui importe pour la souveraineté des données et la confidentialité. Et vous remplacez les frais imprévisibles d'API cloud par un coût matériel fixe — généralement 30-40% de moins en dépenses opérationnelles.

3. Gestion des tours de parole et escalade contextuelles. Si un client dit « Je voudrais un Baconator et... », le système reconnaît que la conjonction « et » signifie que le tour de parole n'est pas terminé, même en cas de pause d'une seconde. Si un client dit « c'est tout », le système répond en moins de 200 millisecondes. Pour les personnes qui bégaient, le système est entraîné sur une parole qui comprend des blocages, des prolongations et des répétitions. Il ne confond pas un silence au milieu d'un mot avec la fin d'une phrase.

L'avantage en matière de conformité est ici crucial pour vos équipes d'audit. Chaque décision — pourquoi le système a attendu, pourquoi il a transmis à un humain, pourquoi il a interprété une commande d'une certaine façon — est traçable. Vous pouvez montrer aux régulateurs exactement comment votre IA a traité une interaction précise. Les tests avant déploiement font appel à des populations de locuteurs diverses. Des garde-fous en temps réel détectent le langage interdit ou les comportements hors script. La surveillance après interaction signale les schémas d'échec afin de permettre une amélioration continue. Et l'escalade automatique transmet les requêtes à forte friction à des humains avant que le client ne soit frustré.

Votre système d'IA vocale devrait produire une piste d'audit, pas un mystère.

Points clés

  • L'IA de drive-thru de Wendy's exige trois tentatives ou plus pour de simples commandes et est décrite comme « inutilisable » pour les 80 millions de personnes qui bégaient dans le monde.
  • 72% des entreprises du S&P 500 déclarent désormais l'IA comme un risque important — contre 12% en 2023 — faisant des déploiements d'IA défaillants une préoccupation au niveau du conseil d'administration.
  • L'IA vocale basée sur le cloud ajoute à elle seule 100-500ms de délai réseau ; le traitement edge ramène ce délai à 5-10ms et réduit les coûts opérationnels de 30-40%.
  • Les nouvelles normes d'accessibilité (CAN-ASC-6.2:2025 et l'European Accessibility Act) exigent que les systèmes d'IA fonctionnent pour les personnes handicapées — avec de lourdes amendes en cas de non-conformité.
  • Mettre en conformité a posteriori un système d'IA non conforme dans des centaines d'établissements coûte jusqu'à cinq fois plus cher que de le concevoir de manière inclusive dès le départ.

En résumé

Déployer l'IA vocale à grande échelle avant qu'elle puisse gérer le bruit réel, la diversité des schémas de parole et les exigences d'accessibilité crée un risque juridique, financier et réputationnel qui s'amplifie à chaque nouvel établissement. La technologie existe pour bâtir des systèmes qui comprennent chaque client — pas seulement les plus faciles. Demandez à votre fournisseur d'IA : pouvez-vous me montrer le taux de précision de votre système ventilé selon la disfluidité de la parole, l'accent et le niveau de bruit de fond — et pouvez-vous produire la piste de décision pour chaque escalade ?

FAQ

Questions fréquentes

Pourquoi l'IA de drive-thru de Wendy's oblige-t-elle les clients à répéter leur commande ?

La cause principale est une couche faible de détection d'activité vocale (VAD) qui confond de brèves pauses — comme un regard vers le menu — avec la fin d'une phrase. Elle envoie un audio incomplet dans le cloud pour traitement, qui renvoie des résultats déformés. Les clients doivent alors se répéter, souvent trois fois ou plus pour de simples commandes.

La commande par IA au drive-thru est-elle accessible aux personnes qui bégaient ?

Les systèmes actuels sont largement considérés comme inutilisables par les personnes qui bégaient. Le bégaiement touche plus de 80 millions de personnes dans le monde. Les modèles standard de reconnaissance vocale sont entraînés sur une parole fluide et interprètent mal les blocages, les prolongations et les répétitions. Certains modèles produisent des résultats avec des scores de sens négatifs — une perte totale de compréhension.

Quels sont les risques juridiques du déploiement d'une IA qui exclut les personnes ayant des troubles de la parole ?

L'ADA interdit la discrimination dans les établissements accueillant le public, et de nouvelles normes telles que CAN-ASC-6.2:2025 exigent expressément que les systèmes d'IA fonctionnent pour les personnes handicapées. L'European Accessibility Act a commencé à être appliqué en juin 2025, avec de lourdes amendes. Mettre en conformité a posteriori un système non conforme sur de nombreux sites peut coûter cinq fois plus cher que de le concevoir de manière inclusive dès le départ.

Développez votre IA en toute confiance.

Collaborez avec une équipe forte d'une solide expérience dans la conception de la prochaine génération d'IA d'entreprise. Nous vous aidons à concevoir, développer et déployer une stratégie d'IA digne de confiance.

Veriprajna société de conseil en Deep Tech est spécialisée dans la conception de systèmes d'IA critiques pour la sûreté destinés aux secteurs de la santé, de la finance et de la réglementation. Nos architectures sont validées au regard de protocoles établis et accompagnées d'une documentation de conformité complète.