
同じ体型でもジーンズによって29と28になる理由:サイズチャートが見落とす真実を解き明かすフィットエンジンの開発
私は自分自身との議論に決着をつけるためにこのデモを構築したが、ドロップダウンを1つ操作するだけで決着がついた。Riley(ライリー)と名付けた合成ショッパー、固定された一連の身体測定値、そして8種類の合成ジーンズのカタログを用意した。伸縮性ゼロの硬い14オンスの生セルビッジ・ストレートジーンズであるIronsideをRileyに試着させると、エンジンが返した結果は「サイズ29、信頼度95%、すべてのゾーンで快適」次にRileyの測定値は一切変えず、商品写真ではほぼ同一に見えるストレッチスリムジーンズのDriftwoodにアイテムを変更したところ、正しいサイズは次まで下がった。28。
同じ体型。同じ測定値。2つの異なる正しいサイズ。そして、現在ほぼすべてのアパレルサイトが実際に使用しているウエストのみのサイズチャートであれば、両方のジーンズに対してまったく同じ数値を表示し、そのうちの1つで間違いを犯していたはずだ。

最終的に完成したプロダクトはContourと呼ばれ、あなた自身も次のURLでまったく同じ比較を実行できる:veriprajna.com/ja/demos/ai-fit-prediction-fashion。しかし、私が話したいのは推奨サイズそのものではない。体型が何も変わっていないのに推奨が変わった理由についてだ。なぜなら、その理由こそが、私がこのようにシステムを構築した論拠のすべてだからである。
ファッション業界はより良い画像で返品問題を解決しようとしてきた
この分野の多くの人々と同様に、私も返品問題は画像処理の問題であると信じてこのプロジェクトを始めた。アパレルの返品はフィット感に関するものが大半を占めており、フィット関連の割合は53%から67%に達し、ショッパーの約63%が2サイズ注文して1つを返品するブラケティング(bracketing)を行っていることを認めている(Veriprajna WP34調査、2026年)。返品物流(リバースロジスティクス)が利益を圧迫しているのだ。業界の解決策は画像をより良くすることだった。より詳細なサイズチャート、次いで3Dアバター、そして身体の写真に衣服をレンダリングする生成型バーチャル試着である。
十分に優れた試着機能があればこのギャップを埋められると確信してしばらく過ごしたが、その後、試着画像が実際に何を示しているのかを冷静に考え直した。それは身体の上のジーンズを見せるだけだ。そのジーンズがその身体にフィットするかどうかを見せるわけではない。生成画像は生地をもっともらしくドレープ(垂下)させることはできても、Rileyが座ったときに太ももの周囲長がその特定のデニムの伸縮限界を超えることにはまったく気づかない。画像は正しく見える。だが縫い目には、レンダリングが決して計算しなかった負荷がかかっているのだ。
バーチャル試着は身体の上のジーンズを見せることはできても、それがフィットするかどうかは依然として把握できない。
それが、私にとってプロジェクトの枠組みを再構築させた言葉だった。サイズチャートは3次元の身体を説明するふりをした4つの1次元の数値に過ぎず、試着画像はフィットデータであるふりをした綺麗な2次元レンダリングに過ぎない。それらは同じ盲点を共有している。どちらも生地を感じることはできない。衣服がフィットするかどうかは視覚的な問題ではない。それは力学的な問題である。すなわち、生地の弾性限界に対して測定される各身体ゾーンの円周方向の歪み(ひずみ)だ。だからこそ、サイズチャートが同一であっても、Rileyは生セルビッジでは29になり、ストレッチデニムでは28になるのだ。

なぜ私はモデルにサイズを選ばせるのをやめたのか?
初期の段階で一度、言語モデルにサイズを選択させたことがあったが、それが自信満々に間違える様子を見たことが、現在のアーキテクチャになった理由である。私の最初の直感はごく当たり前のものだった。身体データをモデルに入力し、衣服データを入力して、サイズを尋ねるというものだ。モデルは即座に流暢に回答したが、硬い生地においては、最も危険な形、すなわち高い確信を持って間違えることが頻繁にあった。真実を決定づける唯一の計算を行うことなく、もっともらしいサイズ回答のパターンを学習していたのだ。
そこで私は、サイズ決定をモデルから完全に切り離した。Contourでは、サイズは単体テスト済みのシンプルなPythonで計算される。候補となる各サイズについて、エンジンはzone_strain = (body_circumference − garment_finished_circumference) / garment_finished_circumferenceをすべてのゾーンで計算し、生地の弾性快適限界と比較して、ゾーンごとの総後悔値が最も低いサイズを選択する。8つの単体テストがその物理計算を厳格に固定している。サイズを決定する経路のどこにもモデルは存在しない。言語モデルにも依然として仕事はある。乱雑なベンダーの説明文を構造化された生地仕様へと読み解き、その結果を「ヒップはぴったり、太ももはゆったり」といった表現に言い換えることだ。助言はするが、決定は決して行わない。
エージェントが助言し、コードが決定する。モデルが数値に対して決定権を持った瞬間、その数値を信頼に足るものにしていた根拠が失われる。
これは時代の変化によって陳腐化しない論点でもあり、なぜより優れたモデルを待たなかったのかと尋ねるエンジニアたちに対する私の答えでもある。完璧な言語モデルが登場したとしても、生地力学、身体の幾何構造、ゾーンごとの歪み計算、そして棄権ポリシーの必要性がなくなるわけではない。どれほど完璧なアドバイザーであっても、決済時に安全であるためには計算された物理量と照合されなければならないのだ。モデルはシステム内の交換可能な1つのアドバイザーに過ぎない。システム(機械)こそがプロダクトなのだ。
推測することを拒否するサイズ
私は「わかりません」と決して言わないバージョンを危うくリリースするところだったが、頑固なテストケースのおかげで思いとどまることができて本当によかった。そのショッパーはJordanで、同じ硬いIronsideセルビッジを試着していた。すっきりした数字が出ることを期待してフィットチェックを実行したが、エンジンは真の競合を浮き彫りにした。小さめのサイズでは太ももが生地の伸縮限界を突破し、大きめのサイズではウエストが緩くなるのだ。伸縮性ゼロのデニムでは、すべてのゾーンをクリアするサイズは存在しない。一方、ウエストのみのチャートは自信満々に28と表示して通り過ぎてしまう。

見出しの精度を良く見せるための魅力的な手口は、常に最も悪くないサイズを表示してそれを推奨と呼ぶことだ。私もそのバージョンを書いた。しかしその後、エンジンに代わりに棄権(abstain)させるようにした。最も悪くないサイズを挙げつつ、信頼度を0.58に下げ、「2サイズ注文するか、スタイリストにご相談ください」とはっきり伝えるのだ。評価全体において、推測する代わりに105組の体型×衣服ペアのうち33組でこの処理を行う。「ここではどの単一サイズも完全には適合しません」という正直な回答は、自信満々の誤った28よりもショッパーにとって価値がある。なぜなら、自信満々の誤った28こそがまさに返品を生む原因だからだ。回答を拒否することは、自分自身のベンチマークへの本能と戦って維持しなければならなかった機能だった。
真実であり得ないベンダーの説明文
カタログには拒絶されるためだけに存在するアイテムがあるが、これは商品説明文の書かれ方に対する強い苛立ちから生まれたものだ。Maverickはそのベンダー自身によって「4方向ストレッチを備えたコットン100%の生セルビッジデニム」と記載されている。その主張は物理的に矛盾している。硬い織物の生セルビッジが4方向ストレッチであるはずがない。しかし単純な抽出器は「4方向ストレッチ」を読み取り、生地があらゆるサイズ差を許容すると都合よく思い込んで、危険なほど間違ったサイズを平気で提示してしまう。
そこで抽出と決定の間に敵対的クリティック(adversarial critic)を配置した。抽出された生地仕様を物理的制約と照らし合わせてチェックし、説明文が自己矛盾している場合は、推論をブロックして人間のレビューにルーティングする。サイズ推奨は発行されない。説明文を読んだモデルではなく、決定論的ルールが最終決定権を持つ。

私がこの例を画面に表示し続けるのは、それがこの問題に対する「AIセーフティ」の誠実な形だからである。失敗モードはモデルが勝手な創作をすることではない。商品説明自体が嘘をついている衣服に対して、モデルが従順に間違えることなのだ。常に回答するシステムはここでも回答し、説明文が真実であったジーンズに対するのとまったく同じ確信度でMaverickについても回答してしまう。重要なのは、「これら2つの事実は両立し得ない」と宣言して停止できるレイヤーを持つことなのだ。
数字が実際に語っていること、そして語っていないこと
私はベンチマークを重視しており、その適用範囲を正直に述べることをさらに重視している。なぜなら、正直な数字こそが永続的なものだからだ。ラベル付けされた105組の合成ゴールデンセット(15の体型×7つの評価対象衣服)において、Contourのエンジンは100%を記録し、これに対しウエストのみのサイズチャートは60%であった。これは67.6%のペアでブラケティング(複数サイズ注文)を解消し(ショッパーが高い信頼度の1つのサイズを得られるため2サイズ注文する必要がない)、39件のフィット競合(チャートのウエスト一致で選ばれたサイズが別のゾーンで不適合になることを歪みモデルが証明したケース)を検出した。

ここで私が曖昧にするのを拒む点がある。そのゴールデンセットは合成データであり、そのラベルはエンジンが使用しているのと同じ測定可能な生地伸縮率の数値を用いているため、完全に独立したオラクル(絶対基準)ではない。100%という数字はこの構築されたデータセットの特性であり、現実世界における完璧なフィット予測を保証するものではないし、誰にもそのような引用はさせない。私が実際に支持する数字は、実際の既存手法に対する+40ポイントの向上である。すなわち、現在ほとんどの店舗が採用しているウエストのみのチャートに対して、同じラベルで測定した結果である。その優位性は、あるべき場所でまさに最大となっている。硬いセルビッジやテーラード衣服においてであり、そこではチャートの正解率は33%にまで低下する。硬い生地はサイズの誤りを容赦なく露呈し、伸縮性のあるニットはそれを許容するからだ。物理法則が最も厳しく作用する領域こそ、画像が最も役に立たない場所であり、このエンジンが真価を発揮する場所なのだ。
正直な見出しは「精度100%」ではない。「あなたの店舗がすでに信頼しているチャートより40ポイント優れており、その差の大半はデニムにある」なのだ。
これらすべての推奨は、再現可能なJSONレシートも出力する。各パラメータの根拠となった正確な元の言い回しを含む抽出済み生地仕様、サイズごとの完全な歪みマトリクス、そして最終決定である。したがって、回答は単なる数値ではない。中身を開いて精査できる数値であり、同じペイロードはAIショッピングエージェントが直接呼び出せる/api/fitエンドポイントでも提供される。コマースが私たちの代わりに取引を行うエージェントへと移行するにつれ、エージェントが利用するサイズ決定シグナルは機械可読であり、信頼度スコアが付与され、監査可能でなければならない。画像ではなく、レポートなのだ。
私が立ち戻り続ける問い
私は最初、より優れた推測器を作っているつもりでこれに取り組み始めたが、最終的には計測機器に近いものを作ったのだと確信するに至った。興味深い仕事はサイズを予測することでは決してなかった。システムが何を主張することを許されるか、いつ棄権しなければならないか、どの矛盾を拒絶しなければならないか、そして事後に各回答をどのように証明するかを決定することだった。ドロップダウンを硬いジーンズからストレッチジーンズに切り替え、変わっていない体型の下で正しいサイズが変わるのを見るとき、私が感じるのは「モデルが賢い」ということではない。「物理法則は本物であり、私たちはついにそれを画像の背後に隠すのをやめたのだ」ということだ。あなたも同じドロップダウンをveriprajna.com/ja/demos/ai-fit-prediction-fashionで切り替えて、その様子を確かめることができる。
そして、文章での説明を読むよりも実際に見たいという方のために、エンドツーエンドで動作する全体をここで紹介する。
私が考え続けており、他のビルダーたちと真剣に議論したい問いは、私たちが他のどのような場面で力学的事実をより綺麗な画像で覆い隠してしまっているかということだ。ファッション業界は10年間にわたりより良い画像を求め続けてきたが、その答えはどんなエンジニアでも単体テストできる歪み計算の中に存在していた。では、あなた自身の領域において、誰もがレンダリングしようとし続けているものの根底にある「力学的事実」とは何だろうか。そしてあなたはその事実について、検証可能な数値よりも画像を信用するだろうか?


