為 AI 創意建預出貨關卡讓我明白:相似度分數分不出你的 Pantone 紅與競爭對手的紅。CIEDE2000 可以。
Artificial IntelligenceBrand StrategyMarketing

模型把明顯錯誤的紅評為符合品牌 0.97。那個數字改變了我做的東西。

Ashutosh SinghalAshutosh Singhal2026年6月27日16 min

我還記得那個精確數字,因為它讓我很難堪。0.968。一個通用相似度模型看著一件假日素材——主視覺紅明顯、一看就錯——卻把它評為符合品牌 0.97。在 1.0 代表完美的尺度上,它告訴我這件創意幾乎可以出貨了。

這個專案一開始,我以為困難的問題正好相反。我以為可信 AI 內容裡真正有意思的工作,是把生成做得更好、教模型打中品牌精確的紅、把提示詞收緊到輸出看起來對為止。我在做 Brand Fidelity Firewall,一個示範:每個 AI 生成的行銷素材在出貨前都必須通過的預出貨關卡。而我一直想讓模型來當裁判。模型恰恰是我最不該信任去做那份工作的東西。

這是一個錯誤數字如何把整件事重排的故事。若想看成品對一批即時素材下判斷,它跑在 veriprajna.com/zh-Hant/demos/brand-ai-content。但示範本身是最容易看的部分。值得寫下來的,是我如何學會不再要求模型去做它做不到的事。

我先做了錯的東西

我從多數人起步的地方開始:相似度分數。這個直覺合理。你有品牌手冊,又有生成素材,你想要一個單一數字說它們有多接近。市面上每個 AI 美學工具都給你那個數字,感覺像治理。它不是治理。它是帶小數點的感覺。

為了讓示範誠實,我發明了一個假品牌來對測,因為我不會把真公司的創意丟進概念驗證。那個品牌是 「Lumiere」,一家合成的精品屋,標語是「Quiet luxury, since 1984。」 其主色是 Lumiere Crimson,Pantone PMS 484,色碼 #9E2B25,每色容差 3.0。下游一切都對照那本品牌手冊衡量。品牌是虛構的,但像素與規格是真的——這是測試一項檢查是否真正有效的唯一方法。

接著我組了一批十二件假日素材,同樣是合成的平面版面,刻意讓每項檢查量的是真實像素,而不是攝影雜訊。防火牆本身不生成任何東西。它攝入預先生成的素材,決定什麼可以安全出貨,所以這十二件是我撰寫的測試夾具,用來操練檢查。其中十一件沒問題。一件——我標成 a08 的素材——主視覺紅是任何藝術指導隔著房間都會擋下的紅。它匹配 #9D2E0B,約佔面積的 46%。那是另一種紅。不是微妙不同。是錯的。

而相似度分數卻愛上了它。

一個分不出你的紅與競爭對手的紅的數字,量的不是你的品牌。它量的是亮度,然後聳聳肩。

值得理解它為什麼愛上它,因為那就是整個論點。我用的通用基線是真實的 感知雜湊、基於 DCT 的 pHash,與內容平台用來抓近重複影像的同一類技術。它刻意做成對色彩穩健。它在意結構與亮度,所以同一張照片重新上色或壓縮後仍能認出。那種穩健正是去重想要的性質,也正是讓它當品牌裁判毫無用處的性質。它看著一個構圖正確、卻倒進錯誤紅色的版面,只看見構圖正確的版面。0.968。 它本來會放行出貨。

相似度分數實際看到什麼?

我向人解釋這件事時,會把那張截圖一直開著,因為面板說得比我還直白。左邊是偏離品牌的素材。右邊是防火牆對它的判讀。

Brand Fidelity Firewall 針對素材 a08 的證據面板,顯示品牌色測得 ΔE00 7.12、對照容差 3.0,匹配色碼 9D2E0B 對比品牌的 9E2B25,並註記通用感知雜湊基線將其評為 0.968 符合品牌、本來會放行出貨。
同一件素材,兩種判決。通用感知雜湊基線評為 0.968 符合品牌。以 CIEDE2000 量測,主視覺紅相對 Lumiere Crimson 的 ΔE00 為 7.12,容差是 3.0,因此關卡予以擋下。

那兩個數字之間的落差就是整個產品。7.12 對照容差 3.0。 那是以 CIEDE2000——ISO 與 CIE 的標準感知色差度量,寫作 ΔE00——測得的色差。它不是相似度猜測,也不是我發明的東西。它是色彩科學界已對「這兩種顏色在人眼看起來差多少」這個問題達成共識的數字。ΔE00 為 7.12、容差為 3,是硬失敗。相似度分數的 0.97 與 ΔE00 的 7.12 看著同一批像素卻完全不同意,而只有其中一個在量品牌真正在意的事。

第一次把那兩個讀數並排放在一起時,我完全停止思考生成。生成器有多好都無關緊要。再完美的生成器仍會產出必須對照精確規格量測的素材,而相似度模型在結構上就無法做那種量測。 問題從來不是做出更好的創意。問題是知道什麼可以安全出貨。

我想把一件事說清楚,因為這是人們常過度吹噓的地方。我這裡沒有跑 CLIP。CLIP 是很多「AI 品牌評分」簡報會點名的度量;真的跑起來是有文件可查的即插即用,但它會拖進大約兩 GB 的相依,而且展示的失手與 pHash 免費就能展示的完全相同。所以示範裡的基線,是對通用相似度取徑的誠實感知雜湊替身,不是穿戲服的 CLIP。無論哪種,論點都成立。相似度——無論你怎麼算——都分不出你的 Pantone 紅與錯誤的紅。 色彩科學可以。

我試過讓模型當裁判。它答得很流暢,卻是錯的。

我並不是優雅地得出那個結論的。有一段時間我深信正確架構是讓一個夠強的視覺語言模型當仲裁者。把素材給它看、把品牌手冊給它看,請它決定。模型擅長描述影像。總該能告訴我一件素材是否符合品牌吧。

它不能,而失敗的方式正是讓我不安的部分。它不是大聲失敗。它是客氣且自信地失敗。我把偏離品牌的紅交給它,它會產出一段流暢、看似合理的段落,說構圖如何尊重品牌克制的美學,然後落到核准。接著我交給它一件正確的素材,得到同樣流暢的段落,有時卻會標出想像出來的問題。判決是散文,而散文恰恰是你最不希望夾在錯誤的紅與已出貨行銷活動之間的東西。

底下有真實成本,所以我不能把它當成示範裡的趣聞揮掉。消費者已開始把差異計入價格。據 Gartner 2026 年 3 月,半數人說更偏好避免 GenAI 內容的品牌。據 Adobe《2026 Digital Trends》報告,三分之一人一旦發現內容是 AI,就停止與品牌互動。Smartly.io 在 2025 年發現,廣告被測得的信任度在從共創變成全 AI 時,從 48% 掉到 13%。可口可樂的 AI 假日廣告——七萬段生成片段——被公開批評為沒有靈魂。2025 年坎城,DM9 醜聞因 AI 偽造鏡頭導致十二座獎項被撤銷。當下行代價如此具體時,一個產出自信段落而非可證明量測的治理層,不是保障。它是有禮貌的負債。

若擋在錯誤素材與上線活動之間的東西,能被一句話談成任何結果,它就不是關卡。它是建議。

於是我不再試圖讓模型當裁判。那是轉折。之後我建的一切都假設:模型是系統裡最不可信的元件,不是最聰明的那個。

為什麼是色彩科學,而不是更好的提示詞?

我選擇把色彩檢查做成堅硬、無可爭辯的核心,也想解釋為什麼我信任它的方式是我從未信任過模型的。CIEDE2000 不是我調到示範好看為止的啟發式。它是已公開的公式,附有參考測試資料,而我用 Sharma et al. reference color pairs 驗證了我的實作。有一個單元測試 test_ciede2000_matches_sharma,並作為套件中五個通過測試之一通過。這比聽起來更重要。意思是 7.12 不是我對這紅有多錯的意見。它是可重現的量測,色彩計量師可以對照教科書核對。

那就是我能向懷疑的品牌總監辯護的數字,與我必須道歉的數字之間的差別。當相似度模型說 0.97,有人問為什麼,誠實答案是「模型覺得是那樣。」當 ΔE00 說 7.12、容差 3,答案是「這是 CIELAB 裡的兩個顏色,這是標準公式,這是參考驗證,而這裡是 7.12 超過 3 的地方。」其中一個答案撐得過法務審查。另一個只撐得到第一個刁鑽問題。

能追溯到公開公式的判決撐得過法務審查。只能解釋成模型直覺的判決,只撐得到第一個刁鑽問題。

我也學會謹慎選擇在哪裡量測顏色。若以整張影像判斷,一個小小正確的標誌就能把平均拖回容差內,而巨大錯誤的主視覺區卻出貨了。所以檢查專門判斷主導的飽和主視覺區——這就是偏離品牌的紅即使角落坐著完全正確的真 crimson 標誌仍會被抓到的原因。關卡看的是人眼最先看的地方。

關卡必須無聊

中途我給自己訂了一條規則:做決定的東西必須無聊。無聊意味著確定性、普通程式碼、在任何模型之外、可測試、可重現。一旦決定依賴模型的心情,它就不再可稽核,而可稽核的判決才是全部價值。

所以關卡正是那樣。任何硬失敗它就 BLOCK,真正該由人接手的案例它就 FLAG,其餘則 PASS。有一個我比任何單一功能都更在意的、經單元測試的不變量,test_gate_invariant_no_hard_fail_passes任何有硬失敗的素材,絕不會被回傳為 PASS 或 FLAG。 它漏不過去。那是你可以證明的性質,不是你指望的行為。

顏色不是唯一的硬擋,我刻意建了第二個與顏色無關的硬擋,證明關卡不是只會量色的單招儀表。素材 a09 有完美的 crimson,ΔE00 為 0.00,死準 Lumiere Crimson。關卡還是擋下它。

素材 a09 的證據面板,顯示品牌色 ΔE00 為 0、對照容差 3,但標誌淨空測得 11px、要求為 24px,因而以幾何而非顏色產出 BLOCK 判決。
素材 a09 有無瑕的 crimson,ΔE00 0.00,卻仍被擋下。標誌淨空是 11px,品牌要求 24px。這次擋下是幾何,不是顏色——這才是重點。

第三個硬擋是法規,而且是帶真實日期的那個。若 AI 內容出貨進入要求機器可讀 AI 內容揭露的市場,卻缺少揭露,無論像素多好都是硬擋。素材 a10 是乾淨、符合品牌的版面,要進歐盟卻沒有 Article 50 標籤。歐盟 AI 法 Article 50 的揭露義務可強制執行於 2026 年 8 月 2 日,罰則最高 1,500 萬歐元或營業額的 3%。 紐約的 SB-8420A 落在 2026 年 6 月 9 日。加州的 CAITA 於 2026 年 8 月到來。FTC 第 5 條壓在這一切之上。缺少必要標籤不是風格備註。它是等著發生的罰款,關卡也如此對待它。

在完整十二件素材的示範批次上,切分結果是 七件 PASS、三件 BLOCK、兩件 FLAG。 在這個特定固定批次上,自動放行率是 58.3%;我特意說「這個特定批次」,因為那是對十二件合成素材算出的結果,不是對你產線的承諾。

Brand Fidelity Certificate 批次報告,標題為 12 件創意中有 7 件無需人工即可放行出貨,顯示 58.3% 自動放行率、7 件放行、3 件擋下、2 件標記,以及 1 件被 ΔE00 抓到而通用相似度分數漏掉的案例,下方是逐件判決表。
十二件素材示範執行的批次憑證。七件放行、三件擋下、兩件標記,以及最關鍵的一件:被 ΔE00 抓到、通用相似度分數本來會放行的素材。信任不變量寫在頂部。

兩件 FLAG 案例是我最自豪的,因為那是誠實系統說「我不知道,必須由人決定」的案例。素材 a11 含有 AI 生成的人臉,因此轉給人做真實性簽核,而不是被唬成 PASS 或 BLOCK。那是 NielsenIQ 的負面光環風險——AI 生成人臉可能拉低品牌觀感的發現——不該由程式碼獨自做決定。素材 a12 瞄準日本,一個品牌手冊涵蓋範圍外的市場,因此揭露規則未知,轉給法務而不是被錯誤放行。從不承認不確定性的關卡,不是嚴謹。那是魯莽。

模型仍然擅長什麼

我沒有扔掉模型,也想誠實說明它落在哪裡,因為「我們拿掉了 AI」會是謊言,也是浪費。視覺語言模型仍在管線裡。它只是沒有投票權。它寫一則諮詢註記——一次可更換供應商的呼叫——且僅供資訊參考。若沒有金鑰或出錯,它乾淨棄權,且從不改動 PASS、FLAG 或 BLOCK。

素材 a08 的 LLM 審閱卡,標為 advisory,寫著偏離規格的 crimson 在 ΔE00 7.12 對消費者讀起來是明顯錯誤的紅,並廉價化 Lumiere 的靜奢簽名;顯示在它不影響的確定性 BLOCK 判決下方。
模型對偏離品牌之紅的貢獻:一則有根據的註記,說明偏離規格的 crimson 在 ΔE00 7.12 讀起來是明顯錯誤的紅,並廉價化品牌簽名。它標為 advisory,坐在關卡已決定的 BLOCK 之下。
模型盡可以再流暢、再自信。它仍然無法讓錯誤的紅出貨。

把那則諮詢註記放在判決旁邊讀,就能看見我追求的健康分工。關卡已依 7.12 對 3.0 的力道說了 BLOCK。模型補上人味、為什麼重要、品牌總監真正想讀的那句話。那確實有用。那是脈絡,不是判斷。確定性關卡做決定。模型只提供諮詢。 一旦我把模型放在那個位子,我就不再為它緊張。它的流暢從風險變成功能,因為那流暢現在坐在一個它無力撼動的判決底下。

每件放行的素材都會匯出一份 Brand Fidelity Certificate——JSON 外加可列印 HTML——承載逐項檢查量測、哪些元素是 AI 相對人工的來源、各市場揭露狀態、關卡結果、模型與版本,以及時間戳。我該小心說明那份文件是什麼。它是可歸檔的證據產物,一份可重現的量測與決定收據。它不是法律認證,也不是法律意見。若稱之為「EU AI Act certified」,正好是這整個專案要拒絕的那種自信過度陳述。

生成從來不是瓶頸

我一再回到那個 0.968 的瞬間,因為它顛倒了我對困難問題落在何處的感覺。我曾假設生成器愈好,信任問題就會縮小。做出這件事說服我正好相反。更好的生成器更快、更大批量地產出錯誤的紅。它不會告訴你紅是錯的。模型品質碰不到一件素材是否匹配 PMS 484、是否帶有 Article 50 標籤這些問題,而那些才是決定什麼可以安全出貨的問題。

比較刺耳的版本——我已開始大聲說的——是:可信 AI 內容堆疊裡最重要的部分幾乎沒有 AI。色彩檢查是標準機構的公式。淨空檢查是幾何。揭露檢查是對照有日期法條的規則引擎。系統裡那一個模型不被允許決定任何事。那感覺像件奇怪的東西,直到我想起整點就是要能證明判決,而你無法證明一段散文。

你可以自己跑成品關卡,看它在 veriprajna.com/zh-Hant/demos/brand-ai-content 抓住那道紅。我更希望你帶走的是它留給我的問題。若你的治理層能被一句自信的句子談成核准錯誤的紅,它究竟治理過什麼?還是你只是生成得更快,卻把速度叫做策略?

若你寧願看它跑、而不是讀我描述,這裡是整座關卡端到端執行。

我不認為那個問題會隨模型變好而變容易。我認為它會變得更尖銳。

相關研究

同步發佈於

自信打造您的 AI。

與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。

Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。