Construir una compuerta previa al envío para creativo con IA me enseñó que una puntuación de similitud no distingue tu rojo Pantone del de un competidor. CIEDE2000 sí.
Artificial IntelligenceBrand StrategyMarketing

Un modelo calificó un rojo visiblemente incorrecto con 0.97 como fiel a la marca. Ese número cambió lo que construí.

Ashutosh SinghalAshutosh Singhal27 de junio de 202616 min

Recuerdo el número exacto, porque me avergonzó. 0.968. Un modelo genérico de similitud miró un recurso navideño cuyo rojo protagonista era visiblemente, obviamente incorrecto, y lo calificó con 0.97 como fiel a la marca. En una escala donde 1.0 significa perfecto, me dijo que ese creativo estaba tan bueno como si ya estuviera enviado.

Había pasado el primer tramo de este proyecto asumiendo que el problema difícil era el contrario. Pensaba que el trabajo interesante en el contenido de IA fiable era mejorar la generación, enseñar a un modelo a acertar el rojo exacto de la marca, afinar los prompts hasta que la salida se viera bien. Estaba construyendo el Brand Fidelity Firewall, una demo de una compuerta previa al envío que todo recurso de campaña generado con IA debe superar antes de publicarse. Y seguía recurriendo al modelo para que fuera el juez. El modelo era lo último en lo que debía haber confiado para ese trabajo.

Esta es la historia de cómo un número equivocado reordenó todo. Si quieres ver la versión terminada decidiendo sobre un lote en vivo, corre en veriprajna.com/es/demos/brand-fidelity-firewall-una-puerta-previa-al-lanzamiento-para-contenido-de-ia. Pero la demo es la parte fácil de mirar. Lo que vale la pena dejar por escrito es lo que costó dejar de pedirle al modelo un trabajo que no puede hacer.

Construí primero lo equivocado

Empecé donde empieza la mayoría, que es con una puntuación de similitud. El instinto es razonable. Tienes un manual de marca y un recurso generado, y quieres un solo número que diga qué tan cerca están. Cada herramienta estética de IA del mercado te da ese número, y parece gobernanza. No es gobernanza. Es una sensación con un punto decimal.

Para que la demo fuera honesta inventé una marca falsa contra la que probar, porque no iba a meter el creativo de una empresa real en una prueba de concepto. La marca es "Lumiere," una casa premium sintética con el eslogan "Quiet luxury, since 1984." Su color primario es Lumiere Crimson, Pantone PMS 484, hex #9E2B25, con una tolerancia por color de 3.0. Todo lo que sigue se mide contra ese manual de marca. Es una marca inventada, pero los píxeles y las especificaciones son reales, que es la única forma de probar si una comprobación realmente funciona.

Luego compuse un lote de doce recursos navideños, otra vez sintéticos, maquetas planas construidas para que cada comprobación midiera píxeles reales en lugar de ruido fotográfico. El firewall en sí no genera nada. Ingesta recursos pregenerados y decide qué es seguro enviar, así que los doce son fixtures de prueba que elaboré para ejercitar las comprobaciones. Once estaban bien. Uno, el recurso que etiqueté a08, tenía un rojo protagonista que cualquier director de arte señalaría desde el otro lado de la sala. Coincidía con #9D2E0B en aproximadamente el 46 por ciento de su área. Ese es otro rojo. No sutilmente distinto. Incorrecto.

Y a la puntuación de similitud le encantó.

Un número que no puede distinguir tu rojo del de un competidor no está midiendo tu marca. Está midiendo luminancia y encogiéndose de hombros.

Vale la pena entender por qué le encantó, porque es todo el argumento. La línea base genérica que usé es un auténtico hash perceptual, un pHash basado en DCT, la misma familia de técnicas que las plataformas de contenido usan para detectar imágenes casi duplicadas. Está deliberadamente construido para ser robusto al color. Le importan la estructura y la luminancia, así que puede reconocer la misma foto tras un recoloreado o un paso de compresión. Esa robustez es exactamente la propiedad que quieres para la deduplicación y exactamente la propiedad que lo vuelve inútil como juez de marca. Miró una maqueta bien compuesta con un rojo incorrecto vertido dentro y vio una maqueta bien compuesta. 0.968. Lo habría enviado.

¿Qué ve realmente una puntuación de similitud?

Mantengo esa captura abierta cuando se lo explico a la gente, porque el panel lo dice con más claridad de la que yo puedo. A la izquierda, el recurso fuera de marca. A la derecha, la lectura del firewall.

El panel de evidencia del Brand Fidelity Firewall para el recurso a08, que muestra el color de marca medido a ΔE00 7.12 frente a una tolerancia de 3.0, hex coincidente 9D2E0B frente al 9E2B25 de la marca, con una nota de que la línea base genérica de hash perceptual lo calificó con 0.968 como fiel a la marca y lo habría enviado.
El mismo recurso, dos veredictos. La línea base genérica de hash perceptual lo calificó con 0.968 como fiel a la marca. Medido en CIEDE2000, el rojo protagonista está ΔE00 7.12 fuera de Lumiere Crimson frente a una tolerancia de 3.0, así que la compuerta lo bloquea.

La brecha entre esos dos números es todo el producto. 7.12 frente a una tolerancia de 3.0. Esa es la diferencia de color medida en CIEDE2000, la métrica estándar ISO y CIE de diferencia perceptual de color, escrita ΔE00. No es una conjetura de similitud y no es algo que yo inventara. Es el número que el mundo de la ciencia del color ya acordó para la pregunta «qué tan distintos se ven estos dos colores al ojo humano». Un ΔE00 de 7.12 frente a una tolerancia de 3 es un fallo duro. El 0.97 de la puntuación de similitud y el 7.12 del ΔE00 miran los mismos píxeles y discrepan por completo, y solo uno de ellos mide lo que a una marca realmente le importa.

La primera vez que puse esas dos lecturas lado a lado, dejé de pensar por completo en la generación. No importaba qué tan bueno fuera el generador. Un generador perfecto sigue produciendo recursos que hay que medir contra una especificación exacta, y un modelo de similitud es estructuralmente incapaz de hacer esa medición. El problema nunca fue hacer mejor creativo. El problema era saber qué es seguro enviar.

Quiero ser preciso en una cosa, porque es un lugar donde la gente exagera. Aquí no ejecuté CLIP. CLIP es la métrica que nombran muchos discursos de «puntuación de marca con IA», y ejecutarlo de verdad es un reemplazo documentado listo para usar, pero arrastra una dependencia de unos dos gigabytes y demuestra el mismo fallo que un pHash demuestra gratis. Así que la línea base de la demo es un sustituto honesto de hash perceptual del enfoque de similitud genérica, no CLIP disfrazado. El punto sobrevive de cualquier forma. La similitud, comoquiera que la calcules, no puede distinguir tu rojo Pantone de uno incorrecto. La ciencia del color sí.

Intenté hacer del modelo el juez. Respondió con fluidez y estaba equivocado.

No llegué a esa conclusión con elegancia. Durante un tramo estuve convencido de que la arquitectura correcta era dejar que un modelo capaz de visión y lenguaje fuera el árbitro. Muéstrale el recurso, muéstrale el manual de marca, pídele que decida. Los modelos son buenos describiendo imágenes. Seguro que uno podría decirme si un recurso era fiel a la marca.

No pudo, y la forma en que falló es lo que me inquietó. No falló a gritos. Falló con cortesía y confianza. Le entregaba el rojo fuera de marca y producía un párrafo fluido y plausible sobre cómo la composición honraba la estética contenida de la marca, y aterrizaba en aprobar. Luego le entregaba un recurso correcto y obtenía un párrafo igual de fluido que a veces señalaba un problema imaginario. Los veredictos eran prosa, y la prosa es exactamente lo que no quieres entre un rojo incorrecto y una campaña enviada.

Hay un coste real debajo de esto, por eso no pude despacharlo como una curiosidad de demo. Los consumidores han empezado a internalizar esa diferencia al valorar. La mitad dice que prefiere marcas que evitan el contenido de IA generativa, según Gartner en marzo de 2026. Un tercio deja de interactuar con una marca en cuanto el contenido se revela como IA, según el informe Digital Trends 2026 de Adobe. Smartly.io descubrió en 2025 que la confianza medida en un anuncio cae del 48 por ciento al 13 por ciento cuando pasa de cocreado a totalmente IA. El spot navideño de IA de Coca-Cola, setenta mil clips generados, fue llamado sin alma en público. En Cannes en 2025 el escándalo de DM9 vio revocados doce premios por metraje fabricado con IA. Cuando el riesgo a la baja es tan concreto, una capa de gobernanza que produce párrafos confiados en lugar de mediciones demostrables no es una salvaguarda. Es una responsabilidad con buenos modales.

Si lo que se interpone entre un recurso incorrecto y una campaña en vivo se puede convencer de cualquier cosa, no es una compuerta. Es una sugerencia.

Así que dejé de intentar hacer del modelo el juez. Ese fue el giro. Todo lo que construí después asume que el modelo es el componente menos fiable del sistema, no el más inteligente.

¿Por qué ciencia del color, y no un mejor prompt?

Elegí hacer de la comprobación de color el núcleo duro e indiscutible, y quiero explicar por qué confío en ella de un modo en que nunca confié en el modelo. CIEDE2000 no es una heurística que afiné hasta que la demo se viera bien. Es una fórmula publicada con datos de prueba de referencia, y validé mi implementación frente a los pares de color de referencia de Sharma et al.. Hay una prueba unitaria, test_ciede2000_matches_sharma, y pasa como una de cinco pruebas que pasan en la suite. Eso importa más de lo que suena. Significa que el 7.12 no es mi opinión de cuán incorrecto es el rojo. Es una medición reproducible que un colorimetrista podría contrastar con un libro de texto.

Esa es la diferencia entre un número que puedo defender ante un director de marca escéptico y un número por el que tengo que disculparme. Cuando un modelo de similitud dice 0.97, y alguien pregunta por qué, la respuesta honesta es «el modelo lo sintió así». Cuando ΔE00 dice 7.12 frente a una tolerancia de 3, la respuesta es «aquí están los dos colores en CIELAB, aquí está la fórmula estándar, aquí está la validación de referencia, y aquí es donde 7.12 supera a 3». Una de esas respuestas sobrevive a una revisión legal. La otra sobrevive hasta la primera pregunta difícil.

Un veredicto que puedo rastrear hasta una fórmula publicada sobrevive a una revisión legal. Un veredicto que solo puedo explicar como la intuición de un modelo sobrevive hasta la primera pregunta difícil.

También aprendí a ser cuidadoso con dónde se mide el color. Juzgar la imagen completa dejaría que un logotipo diminuto y correcto arrastrara el promedio de vuelta a la tolerancia mientras la enorme región protagonista incorrecta se envía. Así que la comprobación juzga específicamente la región protagonista saturada dominante, que es cómo se atrapa el rojo fuera de marca incluso cuando un logotipo en crimson verdadero está en la esquina siendo perfectamente correcto. La compuerta mira donde el ojo humano mira primero.

La compuerta tiene que ser aburrida

Me impuse una regla a mitad de camino: lo que decide tiene que ser aburrido. Aburrido significa determinista, código llano, fuera de cualquier modelo, testeable y reproducible. En el momento en que una decisión depende del humor de un modelo, deja de ser auditable, y un veredicto auditable es todo el valor.

Así que la compuerta es exactamente eso. Emite BLOCK ante cualquier fallo duro, emite FLAG en los casos que un humano genuinamente debe asumir, y en lo demás emite PASS. Hay un invariante con prueba unitaria que me importa más que cualquier función concreta, test_gate_invariant_no_hard_fail_passes: ningún recurso con un fallo duro se devuelve jamás como PASS o FLAG. No puede colarse. Esa es una propiedad que puedes demostrar, no un comportamiento que esperas.

El color no es el único bloqueo duro, y deliberadamente construí un segundo que no tiene nada que ver con el color, para demostrar que la compuerta no es un medidor de color de un solo truco. El recurso a09 tiene un crimson perfecto, ΔE00 de 0.00, clavado en Lumiere Crimson. Y la compuerta lo bloquea de todos modos.

El panel de evidencia del recurso a09, que muestra el color de marca ΔE00 en 0 frente a una tolerancia de 3, pero el espacio de protección del logotipo medido a 11px frente a los 24px requeridos, produciendo un veredicto BLOCK por geometría más que por color.
El recurso a09 tiene un crimson impecable, ΔE00 0.00, y aun así se bloquea. El espacio de protección del logotipo es 11px frente a los 24px que exige la marca. Este bloqueo es geometría, no color, que es el punto.

El tercer bloqueo duro es regulatorio, y es el que trae fechas reales. Si el contenido de IA se envía a un mercado que exige una divulgación de contenido de IA legible por máquina y falta la divulgación, eso es un bloqueo duro sin importar qué tan buenos sean los píxeles. El recurso a10 es una maqueta limpia y fiel a la marca que va a la UE sin etiqueta del Artículo 50. La obligación de divulgación del Artículo 50 del Reglamento de IA de la UE es exigible el 2 de agosto de 2026, con sanciones de hasta 15 millones de euros o el 3 por ciento de la facturación. El SB-8420A de Nueva York aterriza el 9 de junio de 2026. El CAITA de California llega en agosto de 2026. La Sección 5 de la FTC se sitúa por encima de todo. Una etiqueta obligatoria faltante no es una nota de estilo. Es una multa esperando a ocurrir, y la compuerta lo trata así.

En el lote demo completo de doce recursos, el reparto queda en siete PASS, tres BLOCK, dos FLAG. Eso es una tasa de autoaprobación del 58.3 por ciento en este lote fijo concreto, y digo «este lote concreto» a propósito, porque es un resultado calculado sobre doce recursos sintéticos, no una promesa sobre tu pipeline de producción.

El informe de lote del Brand Fidelity Certificate, encabezado con 7 de 12 creativos liberados para envío sin toque humano, que muestra una tasa de autoaprobación del 58.3 por ciento, 7 liberados, 3 bloqueados, 2 marcados, y 1 atrapado por ΔE00 que una puntuación genérica de similitud pasó por alto, sobre una tabla de veredictos por recurso.
El certificado de lote de la ejecución demo de doce recursos. Siete liberados, tres bloqueados, dos marcados, y el que más importa: un recurso atrapado por ΔE00 que una puntuación genérica de similitud habría enviado. El invariante de confianza se declara arriba.

Los dos casos FLAG son de los que más orgulloso estoy, porque son los casos en que un sistema honesto dice «no lo sé, un humano tiene que decidir». El recurso a11 contiene un rostro humano generado con IA, así que se enruta a una persona para el visto bueno de autenticidad en lugar de dejarse engañar hacia un PASS o un BLOCK. Ese es el riesgo de halo negativo de NielsenIQ, el hallazgo de que los rostros generados con IA pueden arrastrar a la baja la percepción de marca, y no es una llamada que el código deba hacer solo. El recurso a12 apunta a Japón, un mercado fuera de la cobertura del manual de marca, así que las reglas de divulgación son desconocidas y va a legal en lugar de liberarse en falso. Una compuerta que nunca admite incertidumbre no es rigurosa. Es imprudente.

Para qué sigue sirviendo el modelo

No tiré el modelo, y quiero ser honesto sobre dónde aterrizó, porque «quitamos la IA» sería una mentira y también un desperdicio. El modelo de visión y lenguaje sigue en el pipeline. Simplemente no tiene voto. Escribe una nota consultiva, una llamada intercambiable por proveedor, y es solo informativa. Se abstiene limpiamente si no hay clave o si falla, y nunca cambia un PASS, un FLAG o un BLOCK.

La tarjeta de revisión LLM del recurso a08, etiquetada como consultiva, que lee que el crimson fuera de especificación a ΔE00 7.12 se lee como un rojo visiblemente incorrecto para los consumidores y abarata la firma de lujo discreto de Lumiere, mostrada bajo el veredicto BLOCK determinista al que no afecta.
La contribución del modelo al rojo fuera de marca: una nota fundamentada de que el crimson fuera de especificación a ΔE00 7.12 se lee como un rojo visiblemente incorrecto y abarata la firma de la marca. Está etiquetada como consultiva, y se sitúa bajo un BLOCK que la compuerta ya decidió.
El modelo puede ser tan fluido y confiado como quiera. Aun así no puede enviar un rojo incorrecto.

Lee esa nota consultiva junto al veredicto y verás la división sana de trabajo que buscaba. La compuerta ya dijo BLOCK, con la fuerza de 7.12 frente a 3.0. El modelo añade el color humano, el porqué-importa, la frase que un director de marca realmente quiere leer. Eso es genuinamente útil. Es contexto, no juicio. La compuerta determinista decide. El modelo solo aconseja. Una vez que puse al modelo en ese asiento, dejé de estar nervioso por él. Su fluidez pasó de ser un riesgo a ser una función, porque esa fluidez ahora se sitúa debajo de un veredicto que no tiene poder de mover.

Cada recurso liberado exporta un Brand Fidelity Certificate, JSON más HTML imprimible, que lleva las mediciones por comprobación, la procedencia de qué elementos fueron IA frente a humanos, el estado de divulgación por mercado, el resultado de la compuerta, el modelo y la versión, y una marca temporal. Debo ser cuidadoso con lo que es ese documento. Es un artefacto de evidencia archivable, un recibo reproducible de lo que se midió y se decidió. No es una certificación legal y no es asesoramiento legal. Llamarlo «certificado del Reglamento de IA de la UE» sería exactamente el tipo de exageración confiada que todo este proyecto existe para rechazar.

La generación nunca fue el cuello de botella

Sigo volviendo al momento con 0.968, porque invirtió mi sentido de dónde vive el problema difícil. Había asumido que, a medida que los generadores mejoraran, el problema de confianza se encogería. Construir esto me convenció de lo contrario. Un mejor generador produce un rojo incorrecto más rápido y a mayor volumen. No te dice que el rojo está incorrecto. Nada de la calidad del modelo toca la pregunta de si un recurso coincide con PMS 484 y lleva una etiqueta del Artículo 50, y esas son las preguntas que deciden qué es seguro enviar.

La versión incómoda de esto, la que he empezado a decir en voz alta, es que la parte más importante de una pila de contenido de IA fiable casi no contiene IA. La comprobación de color es una fórmula de un organismo de normalización. La comprobación de espacio de protección es geometría. La comprobación de divulgación es un motor de reglas mapeado a estatutos con fecha. El único modelo del sistema no tiene permitido decidir nada. Eso se sintió como una cosa extraña de construir hasta que recordé que el punto entero era poder demostrar el veredicto, y no puedes demostrar un párrafo.

Puedes ejecutar tú mismo la compuerta terminada y ver cómo atrapa el rojo en veriprajna.com/es/demos/brand-fidelity-firewall-una-puerta-previa-al-lanzamiento-para-contenido-de-ia. Lo que preferiría que te llevaras es la pregunta que me dejó. Si tu capa de gobernanza se puede convencer de aprobar un rojo incorrecto con una frase confiada, ¿alguna vez gobernó algo? ¿O solo generabas más rápido y llamabas a la velocidad una estrategia?

Y si prefieres verlo a leerme describirlo, aquí está toda la compuerta corriendo de extremo a extremo.

No creo que esa pregunta se vuelva más fácil a medida que los modelos mejoran. Creo que se vuelve más aguda.

Investigación relacionada

También publicado en

Construya su IA con confianza.

Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.

Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.