电商 AI 准确率 | Vouchmark

修正 HDR 主张。保留 120Hz 回答。

一个购物回答可能包含正确细节,同时也包含错误规格。Vouchmark 演示了针对每项主张的独立类目决策:在合成电视回答中将 HDR10+ 修改为 HDR10,同时保留其受支持的刷新率。

32/32

标注为真实的主张得以保留

固定标注合成评估

60/60

主张裁决与测试夹具标签相符

已预先解构的合成主张用例

47/47

通过/修改记录附带引用信息

测试夹具引用信息存在性,非真实性鉴别

这些结果测试的是针对预设夹具的本地决策规则。它们并不衡量主张提取能力、未见过的消费者流量或生产环境性能。

回答层面的“是”可能掩盖主张层面的错误

合成 Vega 电视草稿声称其支持 HDR10+ 和 120Hz 刷新率。本地类目支持 120Hz,但标明的标准是 HDR10。采纳整个草稿会保留错误的标准;全盘否定则会丢弃受支持的细节。

审查问题更加精确:哪项断言与记录一致,哪项产生矛盾,以及哪项无法确立?这一区分给类目和产品团队提供了有用的依据,用以决定助手可以展示什么内容。

主张决策如何工作

Vouchmark 对助手草稿进行包装。预设场景提供原子主张;独立的自由格式端点支持可选的模型提取或有限的模式回退。视频使用的是预设场景,并不确立提取准确率。

  1. 1. 识别断言与类目属性

    电视输入提供一项 HDR 主张和一项刷新率主张。本地 JSON 类目包含属性值、置信度标签和预设引用字符串。不获取任何外部数据源。

  2. 2. 使用显式规则进行比对

    确定性关卡将 HDR10 与 HDR10+ 识别为不同标准。它纠正不匹配项,并通过刷新率匹配项。其规范化、精选匹配和属性规则具有有限的覆盖范围。

  3. 3. 组合回答并保留决策

    主张层面的提供文本构成展示的回答,除非配置的安全规则予以覆盖。JSON 或可打印 HTML 回执记录了断言的内容、类目所记录的内容以及决策为何发生改变。

未知属性产生弃权(abstention);缺失产品或属性产生超出覆盖范围(outside-coverage)。推断的类目值与已验证值可通过相同的匹配路径,因此回执中的置信度标签至关重要。单独的确定性完整性规则可捕获选定的配置含义;它不会检查散文中所有可能的含义。

跟踪回答从草稿到类目决策的全流程

此处展示的所有产品、记录、草稿和评估用例均为合成数据。预设场景提供其原子主张。诸如 Verified(已验证)等界面标签在本演示中描述的是类目匹配;它们并不确立独立的外部验证。

实际案例:一个电视回答,两项不同决策

消费者询问合成 Vega 电视是否支持 HDR10+ 和 120Hz。预设草稿自信地回答了这两个问题。类目支持该刷新率但记录了不同的 HDR 标准,因此该回答需要进行针对性修改。

预设助手草稿

Yes, the Vega 65" OLED supports HDR10+ and a 120Hz refresh rate.

合成 Vega 电视草稿以及展示的 HDR10 修改和保留的 120Hz 主张。
合成 Vega 回答保留 120Hz,并将 HDR10+ 修改为 HDR10。商店价格、评价和控件仅供示意。打开图片可进行全尺寸查看。

1. 将每项断言与其类目属性进行比对

HDR 断言和刷新率断言作为单独提供的主张传入。每项断言均与其自身的产品属性进行比对,而不是对整句话赋予单个批准标签。下方的类目值在测试夹具中带有 verified(已验证)置信度标签;这些标签是预设的元数据。

合成电视场景中的主张决策
属性草稿断言类目值决策对回答的影响
HDR 标准HDR10+HDR10Correct替换产生矛盾的标准
刷新率120Hz120HzPass保留受支持的细节
HDR 主张对话框,显示断言为 HDR10+、合成类目中为 HDR10 以及修改裁决。
该比对呈现了断言值、类目值和预设夹具引用。该引用不是检索到的制造商文档。打开图片可进行全尺寸查看。

2. 根据这些单独决策组合回答

关卡生成以下展示的回答。HDR 修改同时指明了记录值和被拒绝的断言;刷新率陈述得以保留。与类目匹配是所演示的检查,而该类目的质量仍然是单独的责任。

展示的回答

Vega 65" OLED TV: HDR is HDR10, not HDR10+ (corrected). Vega 65" OLED TV: Refresh Rate = 120Hz (verified).

3. 检查回执中发生的变化

JSON 和可打印 HTML 回执保留了原始草稿、展示的回答以及两行决策,包括断言值、类目值、置信度标签和夹具引用。审查人员可以检查修改是否悄然丢弃了受支持的刷新率。时间戳和基于哈希的标识符标识了此生成的记录;它们并未使其成为经过签名的、不可篡改的或持久归档的记录。

生成的 Vouchmark 电视回执,包含原始草稿、提供的回答和两行主张决策。
实际生成的回执保留了这两项决策及其夹具引用。其时间戳和标识符并不确立签名或不可篡改的托管。打开图片可进行全尺寸查看。

未知评级需要表达不确定性,而非替换值

合成 Summit Ridge 夹克草稿承诺完全防水,而其防水评级属性为 unknown(未知)。关卡对该承诺采取弃权(abstains)。它既没有得出该夹克不防水的结论,也没有凭空捏造评级。类目团队在做出更强的主张之前需要适当的产品凭证。

合成 Summit Ridge 夹克回答因类目评级未知而拒绝确认完全防水。
单独的合成夹克用例对未知的防水评级采取弃权。展示的 0/0 出处百分比并非覆盖范围证据。打开图片可进行全尺寸查看。

配置的隐含关联可揭示遗漏的主张

合成 Nimbus 笔记本电脑草稿称其为极佳的游戏笔记本电脑,并声明其拥有 16GB RAM。其提供的主张列表仅包含内存。确定性完整性规则将游戏表述映射为独立显卡断言,然后将该添加的断言与类目中的集成 Intel Arc 显卡进行比对。内存获得通过;配置的 GPU 隐含关联被修改。这说明了一条有限的解释规则,而非完整的语义提取或对每款游戏的评判。

合成 Nimbus 笔记本电脑展示了受支持的 16GB RAM 主张以及被修改的独显隐含关联。
配置的完整性规则从游戏表述中添加了独立显卡断言。合成类目列出的是集成 Intel Arc 显卡;16GB RAM 得以保留。该规则并非通用的游戏适用性测试。打开图片可进行全尺寸查看。

产品记录无法确立药物相互作用回答

在合成 MagCalm 场景中,查询询问有关血液稀释剂的问题。配置的正则表达式筛查用拒绝回答覆盖了产品回答,并在文本中指名持牌药剂师作为提议的审查去向。药物相互作用字段同样为未知。这演示了暂不提供产品回答的决策;未执行专业转接,也未验证任何医疗建议。

合成 MagCalm 药物相互作用查询,其产品回答被拒绝并带有模拟药剂师去向。
配置的正则表达式筛查拒绝了此合成药物相互作用查询。衔接和升级措辞均为模拟:未联系任何药剂师。其 0/0 出处展示并非覆盖范围证据。打开图片可进行全尺寸查看。

结合测试单元来理解基准测试

固定评估将 60 个已预先解构的主张夹具直接发送至关卡,并将 7 个单独的查询夹具发送至筛查层。它对照预设的期望标签测试本地规则。它并不测试模型提取、未见过的消费者流量、源真实性鉴别或生产环境性能。

固定标注合成评估
度量指标结果统计内容
主张裁决匹配60/6032 项 pass、15 项 correct、10 项 abstain 以及 3 项 outside-coverage 夹具标签
真实主张保留率32/32标注为真实且保持 pass 的主张
植入错误主张拦截28/28非 pass 标注的主张被判定为 correct、abstain 或 outside-coverage;修改后的值仍可提供
引用存在性47/47附带非空夹具引用字符串的 pass/correct 记录
查询筛查匹配7/75 个配置触发项和 2 个普通产品查询
完成的固定合成评估,显示 60 项主张裁决匹配、47 条带引用的已提供记录以及 32 项保留的真实主张。
完整的台账结合了 60 个主张用例与 7 个查询筛查用例。标有 Sony 的行是合成记录,并非经过验证的制造商规格。打开图片可进行全尺寸查看。

该台账结合了不同的测试单元。其 67 的总数并不意味着 67 项产品主张或 67 次专家升级。引用字符串的存在性解释了夹具决策指向何处;它并不对外部制造商来源进行真实性鉴别。

每种审查方法确立的内容

这些是用于审查助手回答的设计选择,而非关于竞品的主张。检索相关类目记录与对照该记录检查特定断言是不同的步骤。

审查方法电视用例揭示的内容遗留问题
采纳全部草稿同时保留 HDR10+ 与 120Hz哪项断言与记录产生矛盾?
全盘拒绝草稿连同受支持的刷新率细节一并移除哪项有用的主张本可保留?
应用主张级类目检查修改 HDR 并保留刷新率相关主张是否已提取,且类目是否健全?

本演示不包含的内容

这是本地规则在合成输入上的演示,而非商城部署。没有实现商城、PIM、结账、支付或专家连接器,且零售控件不执行交易。配置的医疗筛查显示拒绝和提议的药剂师去向;它不会联系专业人士。

本演示不保证完整的主张提取、正确的类目数据、详尽的隐含关联检查或在未见过的回答上的性能。回执是可检查的导出内容,而非经过签名的记录或持久的审计归档。实际部署需要对这些边界进行独立验证。

来自产品与类目审查的问题

这能否在不阻断整个回答的情况下修改错误的产品细节?

Vouchmark 演示了针对单项主张的独立决策。在合成 Vega 电视示例中,它将 HDR10+ 修改为类目值 HDR10,并保留受支持的 120Hz 刷新率陈述。

当我们的类目缺少该信息时会发生什么?

标记为 unknown 的属性产生弃权(abstention);缺失的产品或属性产生超出覆盖范围(outside-coverage)。在合成防雨夹克示例中,展示的回答拒绝确认完全防水,因为评级为 unknown。

这难道只是另一个模型在检查第一个模型吗?

类目裁决和当前的完整性规则是确定性的 Python 规则。只有自由格式的主张提取可以可选地使用模型;预设示例提供其主张,并不衡量模型提取。

它是否连接到我们的 Shopify 店铺或 PIM?

本演示读取本地合成类目和策略记录。商城、PIM、结账和专家集成尚未实现;实际部署需要单独的集成和验证工作。

准确率结果实际测试了什么?

在固定标注合成评估中,所有 60 个已预先解构的主张用例均与其预设的期望裁决相符。7 个查询筛查用例是单独的测试单元;两个结果均不衡量提取完整性、未见过的消费者流量或生产环境性能。

我们能否看到它为何改变了回答?

JSON 和可打印 HTML 审计回执保留了输入草稿、展示的回答以及每项主张的断言、类目值、决策、置信度标签和引用。引用是预设的夹具元数据;回执并非数字签名、不可篡改的归档或持久的审计存储。

技术研究

探索相关研究,获取本演示的更广泛背景。

社交媒体

同步发布于

界定您的购物助手所能支持的范围

从类目、回答和决策边界入手。

我们可以讨论您的产品回答所需的检查、缺失数据规则及评估。本演示是开展该设计探讨的起点。

评估回答边界

  • ✓ 检查类目属性与未知项
  • ✓ 映射草稿回答中可检查的主张
  • ✓ 定义修改与弃权规则
  • ✓ 将关卡测试与提取测试分离开来

规划实施方案

  • ✓ 设计类目与策略集成
  • ✓ 明确主张比对覆盖范围
  • ✓ 确定回执与留存需求
  • ✓ 规划在代表性流量上的验证