
美国零售退货损失 8499 亿美元,而多数想解决时装退货的 AI 都在解决错误的问题
几年前,我做过一个身体测量演示,效果好得出奇。购物者靠墙站好,用手机拍两张照片,几秒钟后我们就能返回数十项身体测量数据,精度在一到两厘米以内。在我们办公室里,光线良好、背景是白墙,效果简直不可思议。我记得看着那些数字返回时,心想我们成功了。
然后我们把它放到真实的卧室里运行。杂乱的背景,一侧摆着一盏台灯,购物者穿着宽松的连帽衫,忙碌一天后疲惫地以某个随意的角度举着手机。同一条在实验室里能达到一到两厘米精度的流程,在真实环境中漂移到了三到五厘米。对一个尺码系统来说,这个差距就是全部关键。腰部三厘米的误差,正是合身尺码与被退货尺码之间的区别。
那个月——眼看着演示级别的精度在接触真实客户后崩溃瓦解——正是我不再相信有任何单一灵丹妙药能解决时装退货问题的转折点。它教会了我这整篇文章要讲的道理:合身问题是机械性的,而非视觉性的,而且它没有唯一的解决方案。这也是我们如今在 Veriprajna 构建的AI 合身预测系统所依据的前提。
零售业中最昂贵的数字
先从一个应该让每一位电商运营者夜不能寐的数字说起:2025 年美国零售退货总额达到8499 亿美元(美国零售联合会数据)。时装是远远最糟糕的品类——服装退货率在 26% 到 40% 之间,而电商平均退货率约为 20.8%。
而且几乎都是同一种失败。尺码、合身度和颜色导致了约 45% 的所有退货,具体到服装领域,53% 到 70% 的退货与合身度有关。70% 的在线时装购物者表示,无法试穿是他们购买前最大的担忧。他们的担忧不无道理。
时装电商因退货损失的钱,比营销、物流和欺诈加起来还要多。根本原因几乎从来不是客户的失误,而是这件衣服不合身。
你看得越仔细,经济账就越糟。处理一次退货的成本在 10 到 65 美元之间,某些情况下会吞掉商品原价的多达 65%。所以一个品牌可以“卖出”一件 40 美元的上衣,却要承担寄出运费、承担退货运费、承担检验和重新包装的费用,最终在一笔本被计入营收的交易上亏本。退货欺诈本身每年就让零售商在这一切之外再损失超过 1000 亿美元。
我接触的大多数团队都想用尺码表来解决这个问题,最近还加上了炫酷的虚拟试穿。我来告诉你为什么这两者瞄准的都是错误的目标。
为什么尺码表从来都无法解决这个问题?
尺码表用四个一维数字——胸围、腰围、臀围、内长——去描述一个三维曲面。这是原罪。它从一开始就注定信息量不够。
情况更糟的是,这个行业没有标准化的分级体系。一个品牌的“中码”对应的身体几何形态,与另一个品牌的“中码”完全不同。我见过数据:女装 6 码的腰线在不同品牌之间的差异可高达五英寸。91% 的购物者需要根据所购品牌的不同选择不同的尺码。虚荣尺码更是刻意加剧了这一点——品牌悄悄调整标签以讨好顾客,这意味着跨品牌比较本质上毫无意义。
所以购物者做了唯一理性的选择。他们采取“括号式”下单。如今 63% 的在线购物者会订购同一件商品的多个尺码,打算除留一件外全部退货——在 Z 世代中这一比例为 51%。仅尺码不确定性一项就驱动了约 42% 的这种行为。
对零售商而言,括号式下单是一场无声的灾难。它使你的寄出运费翻倍,在退货周期内锁死库存,并保证你寄出的至少一半会直接退回来。客户并不是在故意刁难。他们正确地得出结论:你的尺码表不可信,于是他们自掏腰包,把自家客厅变成了试衣间。
我差点掉进去的陷阱
在我们的测量流程遇挫之后,我不断听到的建议都是某种版本的“直接加装一个虚拟试穿”。生成式 AI 让它变得既便宜又漂亮——谷歌在美国、英国和印度推出了购物虚拟试穿;Zalando 与 Levi's 合作在十四个欧洲市场启动了试点。这些系统生成的图像确实非常美。有一阵子我很想相信一张漂亮的图像就是答案。
它不是,而理解其中缘由,是这整门生意的关键枢纽。
生成式虚拟试穿的工作原理是预测统计上最可能出现的像素——它把一件衣服绘制成穿在你身上的逼真图片。但它根本不知道自己展示的是 M 码还是 L 码。它无法告诉你,就这块面料的拉伸极限而言,臀部窄了两厘米。扩散模型不知道它披挂的是四向弹力的罗马布,还是毫无弹性的 14 盎司原色布边牛仔布。它是一次渲染,而不是一次测量。
虚拟试穿让猜测看起来令人信服,却不能让猜测变得正确。
而数据也令人不安地印证了这一点。生成式试穿确实明显提升了转化率和参与度——人们喜欢玩它。但没有任何已发表的证据表明,仅靠生成式 AI 的试穿真的能减少与合身度相关的退货。更糟的是,这些模型带有一种显瘦偏差:它们倾向于把衣服渲染得比现实更讨喜,这反而会扩大预期与实际收到的包裹之间的差距。你可以同时提高转化率又提高退货率。我见过一些团队为第一个数字欢呼,却从未把它与第二个数字联系起来。
那条解释了一切的牛仔裤

让我用一个终于让我彻底想明白的案例把这一点讲具体——牛仔布,全服装领域退货率最高的品类,达到 20% 到 25%。
设想一位购物者在买高端牛仔裤。她量了腰围,与尺码表完美匹配,为 71 厘米,于是订购了 28 码。牛仔裤送到了。腰部合身度与承诺的分毫不差。但她一坐下,大腿就绷紧了,因为 14 盎司的原色牛仔布没有弹性,而尺码表根本就没有大腿围这一项。与此同时,生成式试穿给她展示的是一张站着不动时看起来很棒的讨喜牛仔裤图像。
两种工具都没能捕捉到真实的物理规律:这块面料的抗拉刚度意味着它无法弥合站姿臀部几何形态与坐姿臀部几何形态之间的差异。这块面料注定会输掉这场较量,而再好的摄影也不会向她发出任何警告。
这就是我所说的“机械性”。基于物理的方法把衣服模拟为一个材料实体。它知道面料的弯曲刚度——它如何垂坠——它的抗拉刚度——它如何拉伸——以及它的剪切行为——它如何贴合曲线。它把数字纸样悬垂到 3D 身体网格上,并计算每一点的应变。大腿处的高应变会在任何一件成品发货之前,以红色区域的形式显现在网格上。这不是基于其他购物者的经历所做的猜测。这是对真实面料和真实身体的一次计算。
当你盯着一张应变热力图,它恰恰在日后退货原因代码会标注“大腿处太紧”的位置发红时,你就不再把合身当作一个推荐问题,而开始把它当作一个工程问题来看。
那为什么不是人人都直接做模拟?

因为物理模拟成本高、搭建慢,而且只有在你有足够的输入数据可供喂养时才划算。这是供应商轻描淡写带过的部分,也是当你真金白银花钱时最要紧的部分。
说实话,合身技术共有四个不同的流派,而它们当中没有一个是“答案”的原因在于,每一个都只解决了问题的不同切片。
部署成本最低的是统计式尺码推荐——True Fit、Bold Metrics、Fit Analytics。它们利用购买历史、退货数据以及跨越庞大品牌网络的协同过滤,为购物者匹配尺码。仅 True Fit 一家就借助了横跨 6160 亿美元交易额、9.1 万多个品牌的二十年数据,并在 2026 年 3 月推出了一个能将其合身智能开放给 AI 助手的智能体式购物代理。Bold Metrics 与 Gap 就一套智能体式尺码协议展开合作,并声称退货减少了约 34%。代价是这些都是黑箱:它们只告诉你哪个尺码,从不告诉你为什么,而且在还没有行为数据的全新产品上表现吃力。
我个人从事的那个流派是基于照片的身体测量。3DLOOK 的 YourFit 从一两张智能手机照片中提取 86 个测量点;在与一个泳装品牌为期六个月的研究中,它报告退货率降低了 47%,并把与括号式下单相关的退货降到了 2%。但它的代价恰恰就是让我栽跟头的那个——在受控条件之外精度会下降,它要求购物者付出一些操作,而底层的身体模型偏向“平均”体型。此外还有隐私问题,我稍后会再谈到。
生成式虚拟试穿是第三个流派——漂亮、有利于转化,却对合身度视而不见,原因就在于上文所述的种种。
唯一真正对面料进行推理的流派是基于物理的模拟:CLO3D(被 860 多家公司使用)、Style3D,以及在 3D 身体网格上运行有限元布料模拟的新进入者。Perfitly 将 3D 虚拟人偶与完整的面料悬垂结合起来,报告称把某合作品牌的退货率从 28% 拉低到了约 10%。问题在于,它只有在你已经拥有数字化纸样和面料数据时才有效,所以主要对拥有成熟 3D 设计流程的品牌才现实可行。
不存在最佳的合身技术。只存在最适合你的 SKU 数量、你的数据成熟度以及你退货具体形态的那一个。
一个拥有 5 万个 SKU 的快时尚目录、又没有 3D 纸样的品牌,不应该去购买物理模拟;统计式推荐能更快、更省地见效。而一个拥有数字化纸样、又深受大腿合身问题困扰的高端牛仔品牌,如果不去做模拟,就是在白白把钱留在桌上。真正的错误在于把这些技术当作彼此的竞争对手,而不是当作服务于不同经济账的不同工具。
被我自己的律师毙掉的那个功能
没有人会把这一部分放进销售演示文稿里。就在我们准备好上线身体扫描功能的那天,它撞上了一堵我此前没有足够重视的墙:生物识别隐私法。
根据 GDPR,3D 身体扫描属于“特殊类别”的生物识别数据——这是现有保护最严密的一档。在伊利诺伊州,BIPA 对收集、存储和共享的恰恰就是这类数据施加了严格规定,且具有真正的惩罚力度,而且每年都有更多美国州在扩展类似的法律。我眼看着一个知情同意流程界面弹了出来,它实际上把我们最惊艳的功能对全国相当一部分地区封锁了,直到我们重新设计其工作方式为止。
结果证明那次重新设计是一个特性,而非缺陷。答案是在设备端处理——把测量运算放在购物者的手机上完成,绝不让原始扫描数据离开手机。它如今正作为“隐私优先”标准崭露头角,而它恰好也是让购物者放心到愿意真正使用这个工具的那样东西。但你必须从一开始就为此而设计。若不考虑 BIPA 就往一个时装网站上强加一个身体扫描仪,你造出来的就不是一个合身工具;你造出来的是一场带着试穿按钮的集体诉讼。
AI 合身预测是真实存在,还是只是炒作?
人们不断问我这个问题,而诚实的答案是:底层市场是真实的,且在快速增长——尺码与合身预测这一细分市场预计将从 2024 年的约 10.5 亿美元,到 2029 年大致翻三倍至 29.5 亿美元——但大多数落地部署是炒作,因为它们在理解问题之前就先选定了一项技术。
所以我们不卖单一产品。我们从一个品牌自己的退货数据入手,追问究竟是哪种失败在让他们真金白银地亏钱——是选错了尺码,还是对合身度的预期出了错。然后我们让方法去匹配经济账:为高 SKU 目录采用统计式推荐,为对合身度敏感的品类采用基于照片的测量流程,为其 3D 设计成熟度足以支撑的品牌采用基于物理的模拟——供应商中立、合规隐私,并围绕他们数据中具体的退货模式来构建。这就是我们所构建之物背后的全部理念,而它直接源自我花了整整一个月眼看着“一刀切”答案分崩离析的那段经历。
我还常被问到的另一个问题是,这一切是否值得为此付出集成成本。我以前很怕这个问题,直到我开始看着落地后的数字见分晓:与设计精良的 AI 尺码功能互动的购物者,转化率明显更高,而在第一年实现 25% 到 50% 的退货削减是可以达成的。这里还有一股监管的顺风——欧盟正着手禁止销毁未售出的存货,而逆向物流本身每年就已烧掉数十万吨二氧化碳。你每预防一次退货,省下的都是钱、碳排放和你得以留住的库存。
那次演示教给我的教训,如今已经经受住了多年的检验。一张讨喜的图片能把衣服卖出去。唯有物理——或者诚实运用的正确数据——才能确保它卖出去后不被退回来。时装业花了十年,想靠拍照拍出一个从来都注定要用测量来解决的问题。
