
모델이 눈에 띄게 틀린 레드에 브랜드 적합도 0.97을 매겼습니다. 그 숫자가 제가 만들 것을 바꿨습니다.
그 정확한 숫자를 기억합니다. 창피했거든요. 0.968. 일반적인 유사도 모델이 히어로 레드가 눈에 띄게, 명백히 틀린 홀리데이 에셋을 보고 브랜드 적합도 0.97을 매겼습니다. 1.0이 완벽한 척도에서, 이 크리에이티브는 출고해도 될 수준이라고 말한 셈입니다.
이 프로젝트의 초반, 저는 어려운 문제가 정반대라고 가정하고 있었습니다. 신뢰할 수 있는 AI 콘텐츠에서 흥미로운 일은 생성을 더 좋게 만드는 것, 모델이 브랜드의 정확한 레드를 맞추도록 가르치는 것, 출력이 맞아 보일 때까지 프롬프트를 조이는 것이라고 생각했습니다. 저는 Brand Fidelity Firewall을 만들고 있었습니다. AI로 생성된 캠페인 에셋이 출고 전에 반드시 통과해야 하는 사전 출고 게이트의 데모입니다. 그리고 계속 그 판정을 모델에게 맡기려 했습니다. 그 일을 맡기기엔 모델이 가장 믿을 수 없는 대상이었습니다.
이건 잘못된 숫자 하나가 전체 방향을 바꿔 놓은 이야기입니다. 완성된 버전이 실제 배치를 판정하는 모습을 보고 싶다면 veriprajna.com/ko/demos/brand-ai-content. 하지만 데모를 보는 건 쉬운 부분입니다. 기록할 가치가 있는 건, 모델에게 할 수 없는 일을 맡기기를 그만두기까지 무엇이 필요했느냐입니다.
처음에 잘못된 것을 만들었습니다
대부분의 사람이 시작하는 곳에서 시작했습니다. 유사도 점수입니다. 그 본능은 타당합니다. 브랜드 북이 있고 생성된 에셋이 있으며, 둘이 얼마나 가까운지를 말해 주는 하나의 숫자를 원합니다. 시장의 모든 AI 미학 도구가 그 숫자를 주고, 거버넌스처럼 느껴집니다. 거버넌스가 아닙니다. 소수점 달린 감입니다.
데모를 정직하게 만들기 위해, 실제 회사의 크리에이티브를 PoC에 넣지 않으려고 가짜 브랜드를 만들어 대조군으로 썼습니다. 브랜드 이름은 "Lumiere," 태그라인이 "Quiet luxury, since 1984."인 합성 프리미엄 하우스입니다. 주색은 Lumiere Crimson, 팬톤 PMS 484, 헥스 #9E2B25이며, 색당 허용 오차는 3.0입니다. 이후의 모든 측정은 그 브랜드 북을 기준으로 합니다. 가상의 브랜드지만 픽셀과 스펙은 진짜입니다. 검사가 실제로 작동하는지 시험하는 유일한 방법입니다.
그런 다음 다시 합성으로, 사진 노이즈가 아니라 실제 픽셀을 측정하도록 만든 평면 레이아웃의 홀리데이 에셋 열두 개를 구성했습니다. 방화벽 자체는 아무것도 생성하지 않습니다. 사전 생성된 에셋을 받아들여 출고해도 안전한지 판정하므로, 열두 개는 검사를 검증하려고 제가 만든 테스트 픽스처입니다. 열한 개는 문제없었습니다. 하나, 제가 a08이라고 붙인 에셋은 어떤 아트 디렉터라도 방 건너편에서 바로 잡아낼 히어로 레드를 갖고 있었습니다. 일치한 색은 #9D2E0B이며 대략 면적의 46퍼센트에 걸쳐 있었습니다. 다른 레드입니다. 미묘하게 다른 게 아닙니다. 틀린 겁니다.
그런데 유사도 점수는 그걸 좋아했습니다.
당신 레드와 경쟁사 레드를 구분하지 못하는 숫자는 브랜드를 측정하는 게 아닙니다. 휘도를 재고 어깨를 으쓱하는 겁니다.
그게 왜 좋아했는지를 이해하는 게 중요합니다. 그게 전체 논지이니까요. 제가 쓴 일반 베이스라인은 실제 지각 해시, DCT 기반 pHash이며, 콘텐츠 플랫폼이 거의 중복 이미지를 찾을 때 쓰는 기법 계열과 같습니다. 의도적으로 색에 강건하도록 설계되었습니다. 구조와 휘도를 중시해서, 재채색이나 압축 패스 뒤에도 같은 사진을 알아볼 수 있습니다. 그 강건함은 중복 제거에는 바로 필요한 속성이고, 브랜드 판관으로는 쓸모없게 만드는 속성이기도 합니다. 올바른 구성에 틀린 레드를 부어 넣은 레이아웃을 보고, 올바르게 구성된 레이아웃으로 본 겁니다. 0.968. 그대로 출고했을 겁니다.
유사도 점수는 실제로 무엇을 보는가?
사람들에게 이걸 설명할 때 그 스크린샷을 계속 열어 둡니다. 패널이 제 말보다 더 직설적이거든요. 왼쪽은 브랜드에 어긋난 에셋. 오른쪽은 방화벽이 그걸 읽은 결과입니다.

그 두 숫자 사이의 간극이 제품 전부입니다. 허용 오차 3.0 대비 7.12. 그게 CIEDE2000, ISO와 CIE의 표준 지각 색차 지표로 측정한 색 차이이며, ΔE00으로 표기합니다. 유사도 추측도 아니고 제가 만든 것도 아닙니다. "이 두 색이 사람의 눈에 얼마나 다르게 보이는가"라는 질문에 대해 색채 과학계가 이미 합의한 숫자입니다. 허용 오차 3 대비 ΔE00 7.12는 하드 실패입니다. 유사도 점수의 0.97과 ΔE00의 7.12는 같은 픽셀을 보면서도 완전히 어긋나고, 브랜드가 실제로 신경 쓰는 것을 측정하는 쪽은 하나뿐입니다.
그 두 판독을 처음 나란히 놓았을 때, 생성에 대한 생각은 완전히 멈췄습니다. 생성기가 얼마나 좋은지는 중요하지 않았습니다. 완벽한 생성기라도 정확한 스펙에 대해 측정되어야 하는 에셋을 만들고, 유사도 모델은 구조적으로 그 측정을 할 수 없습니다. 문제는 더 나은 크리에이티브를 만드는 것이 아니었습니다. 출고해도 안전한 것을 아는 것이었습니다.
한 가지는 정확히 하고 싶습니다. 사람들이 과장하기 쉬운 지점이니까요. 여기서 CLIP을 돌리지는 않았습니다. CLIP은 많은 "AI 브랜드 스코어링" 피치가 말하는 지표이고, 실제로 돌리는 것도 문서화된 드롭인이지만, 대략 2기가바이트 의존성을 끌고 오며 pHash가 공짜로 보여 주는 것과 동일한 실패를 입증합니다. 그래서 데모의 베이스라인은 CLIP을 가장한 게 아니라, 일반 유사도 접근을 대신하는 정직한 지각 해시 대체물입니다. 요점은 어느 쪽이든 살아남습니다. 유사도는, 어떻게 계산하든, 당신의 팬톤 레드와 틀린 레드를 구분하지 못합니다. 색채 과학은 할 수 있습니다.
모델을 판관으로 만들려 했습니다. 유창하게 답했고, 틀렸습니다.
그 결론에 우아하게 도달한 건 아닙니다. 한동안은 유능한 비전-언어 모델을 중재자로 두는 게 올바른 아키텍처라고 확신했습니다. 에셋을 보여주고, 브랜드 북을 보여주고, 결정을 물으면 됩니다. 모델은 이미지 설명에 능합니다. 분명히 에셋이 브랜드에 맞는지 말해 줄 수 있을 거라고 생각했습니다.
그럴 수 없었고, 실패한 방식이 저를 불안하게 만들었습니다. 요란하게 실패한 게 아니었습니다. 정중하고 자신 있게 실패했습니다. 브랜드에 어긋난 레드를 주면 구성이 브랜드의 절제된 미학을 존중한다는 유창하고 그럴듯한 문단을 쓰고 승인으로 끝났습니다. 올바른 에셋을 주면 똑같이 유창한 문단이, 때로는 존재하지 않는 문제를 집어냈습니다. 판정은 산문이었고, 틀린 레드와 출고된 캠페인 사이에 산문이야말로 절대 있어서는 안 되는 것입니다.
그 아래에는 실제 비용이 있습니다. 그래서 데모의 호기심으로 흘려보낼 수 없었습니다. 소비자들은 그 차이를 가격에 반영하기 시작했습니다. 2026년 3월 Gartner에 따르면 절반은 GenAI 콘텐츠를 피하는 브랜드를 선호한다고 합니다. Adobe의 2026 Digital Trends 보고서에 따르면 3분의 1은 콘텐츠가 AI로 드러나면 브랜드와의 상호작용을 중단합니다. Smartly.io는 2025년에, 광고가 공동 제작에서 완전 AI로 바뀌면 측정된 신뢰가 48퍼센트에서 13퍼센트로 떨어진다고 밝혔습니다. 7만 개의 생성 클립으로 만든 Coca-Cola AI 홀리데이 스팟은 공개적으로 영혼 없다고 불렸습니다. 2025년 칸에서는 DM9 스캔들로 AI로 조작된 영상 때문에 상 열두 개가 취소되었습니다. 하방이 그처럼 구체적일 때, 입증 가능한 측정 대신 자신만만한 문단을 내는 거버넌스 계층은 안전장치가 아닙니다. 매너 좋은 부채입니다.
틀린 에셋과 라이브 캠페인 사이에 선 무언가가 말로 설득당한다면, 그건 게이트가 아닙니다. 제안입니다.
그래서 모델을 판관으로 만들려는 시도를 멈췄습니다. 그게 전환점이었습니다. 그 이후 제가 만든 모든 것은 모델이 시스템에서 가장 똑똑한 부품이 아니라 가장 신뢰할 수 없는 부품이라고 가정합니다.
왜 더 나은 프롬프트가 아니라 색채 과학인가?
색 검사를 반박할 수 없는 단단한 핵심으로 만들었고, 모델을 결코 믿지 않았던 방식으로 그걸 믿는 이유를 설명하고 싶습니다. CIEDE2000은 데모가 좋아 보일 때까지 튜닝한 휴리스틱이 아닙니다. 참조 테스트 데이터가 있는 공개된 공식이며, 제 구현을 검증한 대상은 Sharma et al. 참조 색 쌍입니다. 단위 테스트 test_ciede2000_matches_sharma가 있고, 스위트에서 통과하는 다섯 테스트 중 하나로 통과합니다. 생각보다 더 중요합니다. 7.12가 레드가 얼마나 틀린지에 대한 제 의견이 아니라는 뜻입니다. 측색학자가 교과서와 대조해 확인할 수 있는 재현 가능한 측정입니다.
그게 회의적인 브랜드 디렉터에게 방어할 수 있는 숫자와, 사과해야 하는 숫자의 차이입니다. 유사도 모델이 0.97이라고 하고 누군가 이유를 물으면, 정직한 답은 "모델이 그렇게 느꼈다"입니다. ΔE00이 허용 오차 3 대비 7.12라고 하면, 답은 "여기 CIELAB의 두 색이 있고, 여기 표준 공식이 있고, 여기 참조 검증이 있고, 여기 7.12가 3을 초과한다"입니다. 그중 하나는 법률 검토를 견딥니다. 다른 하나는 첫 번째 날카로운 질문까지만 견딥니다.
공개된 공식으로 추적할 수 있는 판정은 법률 검토를 견딥니다. 모델의 직감으로만 설명할 수 있는 판정은 첫 번째 날카로운 질문까지만 견딥니다.
색을 어디서 측정하는지도 조심해야 한다는 걸 배웠습니다. 이미지 전체를 판정하면, 작은 올바른 로고가 평균을 허용 오차 안으로 끌어올리며 거대한 틀린 히어로 영역이 출고될 수 있습니다. 그래서 검사는 지배적인 채도 높은 히어로 영역을 특별히 판정합니다. 그래서 코너에 완벽한 크림슨 로고가 있어도 브랜드에 어긋난 레드가 잡힙니다. 게이트는 사람의 눈이 먼저 보는 곳을 봅니다.
게이트는 지루해야 합니다
중간에 스스로에게 규칙을 하나 만들었습니다. 결정하는 것은 지루해야 한다. 지루하다는 건 결정론적이고, 평범한 코드이며, 어떤 모델 밖이고, 테스트 가능하며, 재현 가능하다는 뜻입니다. 결정이 모델의 기분에 의존하는 순간, 감사 가능성을 잃고, 감사 가능한 판정이 전부 가치입니다.
그래서 게이트는 정확히 그렇습니다. 어떤 하드 실패에도 BLOCK하고, 사람이 진짜로 소유해야 하는 경우는 FLAG하며, 그 외에는 PASS합니다. 어떤 단일 기능보다 더 아끼는 단위 테스트된 불변식이 있습니다. test_gate_invariant_no_hard_fail_passes: 하드 실패가 있는 에셋은 절대 PASS나 FLAG로 반환되지 않는다. 빠져나갈 수 없습니다. 그건 바라기만 하는 행동이 아니라 증명할 수 있는 속성입니다.
색이 유일한 하드 블록은 아니며, 게이트가 색 측정기 한 방짜리가 아님을 증명하려고 색과 무관한 두 번째를 일부러 만들었습니다. 에셋 a09는 완벽한 크림슨, ΔE00 0.00, Lumiere Crimson에 정확히 맞습니다. 그런데도 게이트는 차단합니다.

세 번째 하드 블록은 규제이며, 실제 날짜가 붙은 것입니다. AI 콘텐츠가 기계 판독 가능한 AI 콘텐츠 고지를 요구하는 시장으로 출고되는데 고지가 없으면, 픽셀이 아무리 좋아도 하드 블록입니다. 에셋 a10은 깔끔하고 브랜드에 맞는 레이아웃으로 EU로 향하는데 Article 50 라벨이 없습니다. EU AI Act의 Article 50 고지 의무는 2026년 8월 2일부터 집행되며, 벌금은 최대 1,500만 유로 또는 매출의 3퍼센트입니다. 뉴욕의 SB-8420A는 2026년 6월 9일에 적용됩니다. 캘리포니아의 CAITA는 2026년 8월에 옵니다. FTC의 Section 5가 그 위를 덮습니다. 필수 라벨 누락은 스타일 메모가 아닙니다. 대기 중인 벌금이며, 게이트도 그렇게 취급합니다.
열두 에셋 전체 데모 배치에서 결과는 PASS 일곱, BLOCK 셋, FLAG 둘입니다. 이 특정 고정 배치에서 자동 통과율은 58.3퍼센트이며, "이 특정 배치"라고 의도적으로 말합니다. 열두 개의 합성 에셋에 대한 계산 결과이지, 여러분의 프로덕션 파이프라인에 대한 약속이 아니기 때문입니다.

두 FLAG 케이스가 가장 자랑스럽습니다. 정직한 시스템이 "모르겠다, 사람이 결정해야 한다"고 말하는 경우이기 때문입니다. 에셋 a11은 AI로 생성된 사람 얼굴을 포함해 PASS나 BLOCK으로 속이기보다 진정성 서명 승인을 위해 사람에게 라우팅됩니다. 그건 NielsenIQ의 네거티브 헤일로 리스크, AI 생성 얼굴이 브랜드 인식을 끌어내릴 수 있다는 발견이며, 코드만으로 내릴 결정이 아닙니다. 에셋 a12는 브랜드 북 적용 범위 밖인 일본을 대상으로 해서 고지 규칙이 알려지지 않았고, 거짓으로 통과시키기보다 법무로 갑니다. 불확실성을 결코 인정하지 않는 게이트는 엄밀한 게 아닙니다. 무모한 겁니다.
모델이 여전히 잘하는 일
모델을 버린 건 아닙니다. 어디에 자리 잡았는지 솔직히 말하고 싶습니다. "AI를 제거했다"는 거짓이고 낭비이기도 하니까요. 비전-언어 모델은 여전히 파이프라인에 있습니다. 다만 투표권이 없습니다. 자문 노트를 쓰고, 제공자를 바꿀 수 있는 호출 하나이며, 정보 제공용일 뿐입니다. 키가 없거나 오류가 나면 깨끗이 기권하고, PASS, FLAG, BLOCK을 절대 바꾸지 않습니다.

모델은 원하는 만큼 유창하고 자신해도 됩니다. 그래도 틀린 레드를 출고시킬 수는 없습니다.
그 자문 노트를 판정 옆에 두고 읽으면, 제가 원했던 건강한 분업이 보입니다. 게이트는 이미 3.0 대비 7.12의 힘으로 BLOCK이라고 했습니다. 모델은 사람의 색, 왜 중요한지, 브랜드 디렉터가 실제로 읽고 싶은 문장을 더합니다. 그건 진짜로 유용합니다. 맥락이지 판정이 아닙니다. 결정론적 게이트가 결정합니다. 모델은 조언만 합니다. 모델을 그 자리에 두자, 더는 불안하지 않았습니다. 유창함은 리스크에서 기능으로 바뀌었습니다. 이제 그 유창함은 움직일 권한이 없는 판정 아래에 앉기 때문입니다.
승인된 모든 에셋은 Brand Fidelity Certificate를 JSON과 인쇄 가능한 HTML로 내보냅니다. 검사별 측정, 어떤 요소가 AI인지 사람인지의 출처, 시장별 고지 상태, 게이트 결과, 모델과 버전, 타임스탬프를 담습니다. 그 문서가 무엇인지 조심해야 합니다. 측정하고 결정한 것의 재현 가능한 영수증인, 제출 가능한 증거 아티팩트입니다. 법적 인증이 아니며 법률 자문도 아닙니다. "EU AI Act certified"라고 부르는 것은, 이 프로젝트 전체가 거부하려고 존재하는 바로 그 종류의 자신만만한 과장이 될 겁니다.
생성은 결코 병목이 아니었습니다
0.968의 순간으로 계속 돌아갑니다. 어려운 문제가 어디에 있는지에 대한 감각을 뒤집었기 때문입니다. 생성기가 나아질수록 신뢰 문제는 줄어들 거라고 가정했습니다. 이걸 만들며 정반대를 확신하게 되었습니다. 더 나은 생성기는 틀린 레드를 더 빠르고 더 많은 양으로 만듭니다. 레드가 틀렸다고 말해 주지는 않습니다. 모델 품질은 에셋이 PMS 484에 맞는지, Article 50 라벨을 갖는지와는 무관하고, 그 질문들이 출고해도 안전한 것을 결정합니다.
불편한 버전, 제가 소리 내어 말하기 시작한 것은, 신뢰할 수 있는 AI 콘텐츠 스택에서 가장 중요한 부분은 AI가 거의 없다는 것입니다. 색 검사는 표준 기관의 공식입니다. 클리어스페이스 검사는 기하학입니다. 고지 검사는 날짜가 있는 법령에 매핑된 규칙 엔진입니다. 시스템의 유일한 모델은 아무것도 결정하도록 허용되지 않습니다. 판정을 증명할 수 있어야 한다는 게 전부였고, 문단은 증명할 수 없다는 걸 기억하기 전까지는 이상한 구축처럼 느껴졌습니다.
완성된 게이트를 직접 실행해 레드를 잡는 모습을 보려면 veriprajna.com/ko/demos/brand-ai-content. 제가 남기고 싶은 건 그게 남긴 질문입니다. 거버넌스 계층이 자신만만한 문장으로 틀린 레드를 승인하도록 설득당할 수 있다면, 그건 과연 무언가를 규율한 적이 있는가? 아니면 더 빠르게 생성하면서 그 속도를 전략이라고 부른 것뿐인가?
읽는 것보다 보기를 원한다면, 여기 게이트 전체가 끝까지 돌아갑니다.
모델이 나아질수록 그 질문이 쉬워진다고 생각하지 않습니다. 더 날카로워진다고 생각합니다.


