Entwicklung von Contour, einer physikbasierten Passform-Engine: Derselbe Körper braucht in Raw-Selvedge Größe 29 und in Stretch 28 – 40 Punkte besser als Größentabellen.
Fashion TechEcommerceRetail Technology

Derselbe Körper hat in der einen Jeans Größe 29 und in der anderen 28. Ich habe die Passform-Engine gebaut, die erklärt, warum Größentabellen das nicht erkennen können.

Ashutosh SinghalAshutosh Singhal10. Juli 202612 min

Ich habe diese Demo gebaut, um eine Diskussion zu beenden, die ich ständig mit mir selbst führte – und es brauchte nur ein einziges Dropdown-Menü, um sie beizulegen. Ich hatte einen synthetischen Käufer namens Riley, einen festen Satz an Körpermaßen und einen Katalog aus acht synthetischen Jeans. Ich testete Riley mit der Ironside, einer starren 14-Unzen-Raw-Selvedge-Straight-Jeans ohne jeden Stretch, und die Engine lieferte Größe 29, 95 % Konfidenz, bequem in jeder Zone. Dann änderte ich nichts an Riley, wechselte das Kleidungsstück zur Driftwood – einer Stretch-Slim-Jeans, die auf einem Produktfoto fast identisch aussieht –, und die korrekte Größe sank auf 28.

Gleicher Körper. Gleiche Maße. Zwei unterschiedliche korrekte Größen. Und eine Größentabelle, die nur auf die Taille schaut – genau das, was heute fast jede Mode-Website verwendet –, hätte für beide Jeans exakt dieselbe Zahl ausgegeben und bei einer davon falschgelegen.

Contour empfiehlt Größe 29 mit 95 % Konfidenz für Riley bei der Ironside Raw-Selvedge-Jeans, mit dem Hinweis, dass eine reine Taillentabelle Größe 28 angeben und falschliegen würde, während die Dehnungsbalken für jede Zone als bequem angezeigt werden
Riley mit der starren Ironside Raw-Selvedge: Die Engine gibt Größe 29 mit 95 % Konfidenz aus, jede Zone ist bequem, und weist darauf hin, dass eine reine Taillentabelle 28 angegeben hätte. Bei diesem Denim ohne Stretch würde 28 die Dehnungsgrenze des Oberschenkels sprengen.

Das Produkt, das daraus entstand, heißt Contour, und Sie können genau diesen Vergleich selbst ausprobieren unter veriprajna.com/de/demos/ki-passformvorhersage-die-den-stoff-versteht-contour-sizing-engine. Doch worüber ich sprechen möchte, ist nicht die Empfehlung an sich. Es ist der Grund, warum sich die Empfehlung änderte, obwohl sich am Körper absolut nichts geändert hatte – denn dieser Grund ist das entscheidende Argument dafür, warum ich das System genau so gebaut habe.

Die Modebranche versucht seit Langem, Retouren mit besseren Bildern zu lösen

Ich begann dieses Projekt in dem Glauben – wie die meisten in diesem Bereich –, dass das Retourenproblem ein bildliches Problem sei. Bekleidungsretouren werden von Passformfragen dominiert, und der passformbedingte Anteil liegt zwischen 53 und 67 Prozent, wobei rund 63 Prozent der Käufer zugeben, Bracketing zu betreiben – also zwei Größen zu bestellen und eine zurückzuschicken (Veriprajna WP34-Studie, 2026). Die Retourenlogistik frisst die Marge auf. Die Antwort der Branche bestand darin, das Bild zu verbessern: detailliertere Größentabellen, dann 3D-Avatare, schließlich generative virtuelle Anproben, die das Kleidungsstück auf ein Foto Ihres Körpers rendern.

Ich war eine Weile davon überzeugt, dass eine ausreichend gute virtuelle Anprobe die Lücke schließen würde – und dann setzte ich mich damit auseinander, was eine Anprobe tatsächlich zeigt. Sie zeigt Ihnen die Jeans an einem Körper. Sie zeigt Ihnen nicht, ob diese Jeans diesem Körper auch passen wird. Ein generatives Bild kann einen Stoff überzeugend drapieren und hat doch keine Ahnung, dass beim Hinsetzen von Riley der Oberschenkelumfang das übersteigt, was dieser spezifische Denim nachgeben kann. Das Bild sieht stimmig aus. Die Naht steht unter einer Spannung, die das Rendering nie berechnet hat.

Eine virtuelle Anprobe kann Ihnen die Jeans an Ihrem Körper zeigen und hat trotzdem keine Ahnung, ob sie passen wird.

Das war der Satz, der das Projekt für mich völlig neu einordnete. Eine Größentabelle besteht aus vier eindimensionalen Zahlen, die vorgeben, einen dreidimensionalen Körper zu beschreiben, und ein Bild aus einer virtuellen Anprobe ist ein hübsches zweidimensionales Rendering, das vorgibt, Passformdaten zu sein. Sie teilen dieselbe Blindheit: Keines von beiden kann den Stoff spüren. Ob ein Kleidungsstück passt, ist keine visuelle Frage. Es ist eine mechanische Frage: die Umfangsdehnung an jeder Körperzone, gemessen an der elastischen Grenze des jeweiligen Stoffes. Und genau deshalb hat Riley in Raw-Selvedge eine 29 und in Stretch-Denim eine 28, selbst wenn die Größentabelle identisch ist.

Contour empfiehlt Größe 28 für denselben Käufer Riley bei der Driftwood Stretch-Slim-Jeans und stellt fest, dass hier auch die reine Taillentabelle bei 28 landet, da der Stretch den anderen Zonen Spielraum lässt
Derselbe Riley, jetzt mit der Driftwood Stretch-Slim: Die korrekte Größe fällt auf 28 bei 90 % Konfidenz, weil der Stretch-Denim Oberschenkel und Hüfte verzeiht, was der starre Selvedge nicht tun würde. Das Kleidungsstück änderte sich, der Körper nicht – und das Ergebnis passte sich an.

Warum ich aufhörte, dem Modell die Größenauswahl zu überlassen

Ich ließ ganz zu Beginn einmal ein Sprachmodell die Größe auswählen – und mitzuerleben, wie es sich mit voller Überzeugung irrte, ist der Grund, warum die Architektur heute so aussieht. Mein erster Reflex war der naheliegende: Man füttert das Modell mit den Körperdaten, gibt ihm das Kleidungsstück und fragt nach einer Größe. Es antwortete prompt und flüssig, und bei starren Stoffen lag es häufig auf die gefährlichste Art falsch: falsch mit hoher Konfidenz. Es hatte das Muster einer plausiblen Größenantwort gelernt, ohne die eine Berechnung durchzuführen, die über die Realität entscheidet.

Also habe ich die Entscheidung vollständig aus dem Modell herausgelöst. In Contour wird die Größe in schlichtem, durch Unit-Tests abgesichertem Python berechnet. Für jede in Frage kommende Größe berechnet die Engine zone_strain = (body_circumference − garment_finished_circumference) / garment_finished_circumference an jeder Zone, vergleicht den Wert mit der elastischen Komfortgrenze des Stoffes und wählt die Größe mit dem geringsten gesamten Zonen-Regret. Acht Unit-Tests verankern diese physikalischen Regeln felsenfest. Es gibt an keiner Stelle im Prozess ein Modell, das Ihre Größe bestimmt. Das Sprachmodell hat weiterhin eine Aufgabe: unstrukturierte Herstellerbeschreibungen in eine strukturierte Stoffspezifikation zu übersetzen und das Ergebnis in Aussagen wie „eng an der Hüfte, locker am Oberschenkel“ zu formulieren. Es berät. Es entscheidet nie.

Agenten beraten, Code entscheidet. In dem Moment, in dem das Modell über die Zahl abstimmen darf, haben Sie das verloren, was die Zahl überhaupt erst vertrauenswürdig gemacht hat.

Das ist auch jener Teil der These, der nicht an Aktualität verliert, und es ist die Antwort, die ich Entwicklern gebe, die mich fragen, warum ich nicht einfach auf ein besseres Modell gewartet habe. Ein perfektes Sprachmodell würde die Notwendigkeit der Stoffmechanik, der Körpergeometrie, der Zonen-Dehnungsberechnung und der Enthaltungsrichtlinie immer noch nicht überflüssig machen. Selbst ein makelloser Berater muss an einer berechneten Größe überprüft werden, um am Checkout verlässlich zu sein. Das Modell ist lediglich ein austauschbarer Berater innerhalb der Maschine. Die Maschine ist das Produkt.

Die Größe, die das System nicht erraten will

Ich hätte fast eine Version veröffentlicht, die niemals „Ich weiß es nicht“ sagt, und ich bin froh, dass mich ein hartnäckiger Testfall davon abgebracht hat. Der Käufer war Jordan, mit genau demselben starren Ironside-Selvedge. Ich führte den Passform-Check durch und erwartete eine klare Zahl – stattdessen deckte die Engine einen echten Konflikt auf: Bei kleineren Größen überschreitet der Oberschenkel die Dehnungsgrenze des Stoffes bei Weitem, und bei größeren Größen sitzt die Taille viel zu locker. Bei einem Denim ohne jeden Stretch gibt es schlicht keine Größe, die in jeder Zone passt. Die reine Taillentabelle gibt derweil selbstbewusst 28 aus und geht zur Tagesordnung über.

Contour enthält sich bei Jordan bei der Ironside-Jeans, zeigt einen echten Passformkonflikt an, empfiehlt Größe 31 als das geringste Übel mit 58 % Konfidenz bei lockerer Taille und Hüfte sowie dem Rat, mehrere Größen zu bestellen oder eine Stilberatung zu kontaktieren
Jordan mit der starren Ironside: Taille und Hüfte sitzen zu locker (-8 % und -6 %), der Oberschenkel liegt eng an, und keine Größe passt überall sauber. Die Engine benennt die am wenigsten schlechte Größe (31) mit 58 % Konfidenz und enthält sich mit dem Hinweis „Mehrere Größen bestellen oder Stilberatung kontaktieren“, statt eine Zahl vorzutäuschen wie die selbstbewusste 28 der Tabelle.

Der verlockende Schritt, der die plakative Genauigkeit auf dem Papier besser aussehen lässt, besteht darin, immer die am wenigsten schlechte Größe auszugeben und sie als Empfehlung zu deklarieren. Ich hatte diese Version geschrieben. Dann brachte ich die Engine dazu, stattdessen sich zu enthalten: Sie benennt die am wenigsten schlechte Größe, senkt die Konfidenz auf 0,58 und sagt ganz offen: „Bestellen Sie mehrere Größen oder kontaktieren Sie eine Stilberatung.“ Über die gesamte Evaluierung hinweg tut sie dies bei 33 von 105 Körper-Kleidungsstück-Paaren, anstatt blind zu raten. Ein ehrliches „Keine einzelne Größe passt hier einwandfrei“ ist für einen Käufer wertvoller als eine selbstbewusste, falsche 28 – denn genau diese selbstbewusste, falsche 28 führt unweigerlich zur Retoure. Die Antwort zu verweigern, erwies sich als Funktion, für deren Beibehaltung ich gegen meine eigenen Benchmark-Instinkte ankämpfen musste.

Der Herstellertext, der physikalisch unmöglich ist

Ich habe ein Kleidungsstück im Katalog, das einzig dazu existiert, abgelehnt zu werden – und es entstand aus echtem Ärger darüber, wie Produktbeschreibungen verfasst werden. Die Maverick wird vom eigenen Hersteller als „Raw-Selvedge-Denim aus 100 % Baumwolle mit 4-Wege-Stretch“ beschrieben. Diese Behauptung ist physikalisch widersinnig. Ein starrer, gewebter Raw-Selvedge kann nicht gleichzeitig 4-Wege-Stretch besitzen. Ein naiver Extraktor liest jedoch „4-Wege-Stretch“, nimmt gutgläubig an, der Stoff verzeihe alles, und liefert Ihnen mit einem Lächeln eine gefährlich falsche Größe.

Deshalb habe ich zwischen die Extraktion und die Entscheidung einen kontradiktorischen Prüfer geschaltet. Er gleicht die extrahierte Stoffspezifikation mit physikalischen Grenzwerten ab, und sobald sich die Beschreibung widerspricht, blockiert er die Inferenz und leitet den Fall an eine menschliche Prüfung weiter. Es wird keine Größenempfehlung ausgegeben. Die deterministischen Regeln haben das letzte Wort, nicht das Modell, das den Text gelesen hat.

Contour blockiert die Maverick-Jeans, deren Herstellertext Raw-Selvedge und 4-Wege-Stretch verspricht, mit dem Prüferhinweis, dass die Stoffinferenz als mechanisch inkompatibel abgelehnt und zur manuellen Prüfung weitergeleitet wurde, ohne dass eine Größe ausgegeben wird
Der Text der Maverick behauptet gleichzeitig „Raw-Selvedge“ und „4-Wege-Stretch“. Der Prüfer weist die Inferenz als mechanisch inkompatibel zurück – ein starrer Webstoff kann kein 4-Wege-Stretch sein – und leitet sie an eine menschliche Prüfung weiter, ohne eine Empfehlung auszugeben, anstatt einen Widerspruch in eine scheinbar sichere Größe umzumünzen.

Ich lasse dieses Beispiel sichtbar, weil es die ehrliche Variante von „KI-Sicherheit“ für dieses Problem darstellt. Die Fehlerursache liegt nicht darin, dass das Modell zu kreativ wäre. Sie liegt darin, dass das Modell bei einem Kleidungsstück, dessen Beschreibung schlicht lügt, folgsam falschliegt. Ein System, das immer eine Antwort liefert, wird auch hier antworten – und es wird bei der Maverick genauso selbstsicher sein wie bei einer Jeans mit wahrheitsgemäßer Beschreibung. Der ganze Sinn besteht darin, eine Schicht zu haben, die feststellen kann: „Diese beiden Fakten können nicht gleichzeitig wahr sein“, und stoppt.

Was die Zahlen tatsächlich aussagen – und was nicht

Der Benchmark liegt mir am Herzen, und noch mehr liegt mir daran, seinen Rahmen ehrlich zu benennen – denn nur die ehrliche Zahl hat dauerhaft Bestand. Auf einem gelabelten synthetischen Golden Set mit 105 Paaren (15 Körpertypen gegen 7 bewertete Kleidungsstücke) erreicht die Contour-Engine 100 Prozent gegenüber den 60 Prozent der reinen Taillengrößentabelle. Sie eliminiert Bracketing bei 67,6 Prozent der Paare – was bedeutet, dass der Käufer eine einzige, hochgradig verlässliche Größe erhält und nicht zwei bestellen muss – und deckt 39 Passformkonflikte auf: Fälle, in denen die reine Taillenabstimmung der Tabelle eine Größe wählt, bei der das Dehnungsmodell nachweist, dass sie an einer anderen Zone versagt.

Das Benchmark-Panel von Contour zeigt eine Engine-Genauigkeit von 100 Prozent gegenüber 60 Prozent bei der reinen Taillen-Baseline – ein Zuwachs von 40 Prozentpunkten, 105 bewertete Passformen, 39 aufgedeckte Konflikte und 67,6 Prozent Einzelgrößen-Empfehlungen, mit einer Tabelle pro Käufer für die Raw-Selvedge-Jeans
Der Benchmark: Engine 100 % vs. reine Taillentabelle 60 % auf dem 105-Paare-Datensatz, ein Plus von 40 Prozentpunkten, mit 39 aufgedeckten Konflikten und eliminiertem Bracketing bei 67,6 % der Paare. Beim starren Selvedge (obere Tabelle) fällt die Tabelle auf 33 % ab – genau dort, wo die Passform am schwierigsten ist.

Hier ist der Punkt, den ich keinesfalls beschönigen möchte. Dieser Golden Set ist synthetisch, und seine Labels nutzen dieselben messbaren Stoffdehnungswerte, die auch die Engine verwendet; es handelt sich also nicht um ein völlig unabhängiges Orakel. Die 100 Prozent sind eine Eigenschaft dieses konstruierten Datensatzes, kein Versprechen für eine perfekte Passformvorhersage in der realen Welt, und ich werde nicht zulassen, dass sie als solches zitiert werden. Die Zahl, hinter der ich tatsächlich stehe, ist der Vorsprung von +40 Prozentpunkten gegenüber der gängigen Methode der Praxis – der reinen Taillentabelle, die die meisten Online-Shops heute einsetzen, gemessen an denselben Labels. Dieser Vorteil ist genau dort am größten, wo er sein sollte: bei starrem Selvedge und Tailoring, wo die Tabelle auf 33 Prozent einbricht, weil ein starrer Stoff eine falsche Größe gnadenlos bestraft, während ein elastischer Strickstoff sie verzeiht. Wo die Physik am härtesten zuschlägt, hilft ein Bild am wenigsten – und genau dort beweist diese Engine ihren wahren Wert.

Die ehrliche Schlagzeile lautet nicht „100 % Treffsicherheit“. Sie lautet: „40 Punkte besser als die Tabelle, der Ihr Shop heute schon vertraut – und der Großteil dieses Vorsprungs liegt im Denim-Bereich.“

Jede dieser Empfehlungen erzeugt zudem einen reproduzierbaren JSON-Beleg: die extrahierte Stoffspezifikation mit den exakten Quellphrasen, die jeden Parameter bestimmt haben, die vollständige Dehnungsmatrix pro Größe und die endgültige Entscheidung. Das Ergebnis ist also nicht bloß eine Zahl. Es ist eine Zahl, die Sie aufschlüsseln und detailliert überprüfen können – und derselbe Daten-Payload wird an einem /api/fit-Endpunkt bereitgestellt, den ein KI-Shopping-Agent direkt aufrufen kann. Da sich der Handel hin zu Agenten entwickelt, die Transaktionen für uns abwickeln, muss das Passformsignal, das sie verarbeiten, maschinenlesbar, konfidenzbewertet und auditierbar sein. Ein Bericht, kein Bild.

Die Frage, die mich immer wieder beschäftigt

Ich ging an dieses Projekt mit dem Gedanken heran, ein besseres Schätzwerkzeug zu bauen – und am Ende war ich überzeugt, etwas geschaffen zu haben, das vielmehr einem Messinstrument gleicht. Die interessante Arbeit bestand nie darin, eine Größe vorherzusagen. Es ging darum festzulegen, was das System behaupten darf, wann es sich enthalten muss, welche Widersprüche es ablehnen muss und wie es jede Antwort im Nachhinein belegt. Wenn ich jenes Dropdown-Menü von der starren Jeans auf die Stretch-Jeans umstelle und beobachte, wie sich die korrekte Größe bei einem unveränderten Körper ändert, ist mein Gefühl nicht: „Das Modell ist klug.“ Es ist: „Die Physik ist real – und wir haben endlich aufgehört, sie hinter einem hübschen Bild zu verstecken.“ Sie können dasselbe Dropdown-Menü unter veriprajna.com/de/demos/ki-passformvorhersage-die-den-stoff-versteht-contour-sizing-engine umstellen und es selbst miterleben.

Und falls Sie es lieber sehen möchten, statt meine Beschreibung zu lesen, finden Sie hier den gesamten Ablauf von Anfang bis Ende.

Die Frage, die mich nicht loslässt – und über die ich gerne mit anderen Entwicklern diskutieren würde –, ist: An welchen anderen Stellen kaschieren wir eine mechanische Tatsache mit einem hübscheren Bild? Die Modebranche hat sich ein Jahrzehnt lang an besseren Bildern abgearbeitet, während die eigentliche Antwort in einer Dehnungsberechnung lag, die jeder Ingenieur mit Unit-Tests absichern könnte. Was ist also in Ihrer eigenen Domäne die physikalische Tatsache unter dem Phänomen, das alle ständig zu rendern versuchen – und würden Sie einem Bild davon mehr vertrauen als einer Zahl, die Sie nachprüfen können?

Verwandte Forschung

Auch veröffentlicht auf

Entwickeln Sie Ihre KI mit Zuversicht.

Arbeiten Sie mit einem Team zusammen, das über umfassende Erfahrung im Aufbau der nächsten Generation von Unternehmens-KI verfügt. Wir helfen Ihnen, eine KI-Strategie zu entwerfen, zu entwickeln und einzuführen, der Sie vertrauen können.

Veriprajna Deep-Tech-Beratung ist auf die Entwicklung sicherheitskritischer KI-Systeme für die Bereiche Gesundheitswesen, Finanzen und Regulierung spezialisiert. Unsere Architekturen werden anhand etablierter Protokolle validiert und mit umfassender Compliance-Dokumentation belegt.