Construir The Standards Desk, una compuerta de procedencia para la IA de archivo de un editor, me enseñó que lo seguro de publicar es gobernanza, no del modelo.
MediaArtificial IntelligenceAI Governance

Mi IA de redacción inventó una cita que la alcaldesa nunca dijo. Atraparla antes de que los lectores la vieran es todo el producto.

Ashutosh SinghalAshutosh Singhal2 de julio de 202614 min

La primera vez que vi cómo mi propio respondedor ponía palabras en boca de una alcaldesa, sentí ese frío concreto que llega al darte cuenta de que construiste aquello de lo que tenías miedo.

Le había hecho una pregunta llana de lector: ¿Qué prometió la alcaldesa Reyes a los promotores sobre la parcela del frente fluvial? El archivo que leía, una corrida sintética de 13 años de un periódico ficticio al que llamo The Riverbend Ledger, no registra ninguna promesa de ese tipo. Un artículo anota de hecho que la parcela «no estaba en la agenda». Nada de eso detuvo al modelo de lenguaje. Devolvió una frase fluida y segura de sí misma, con comillas: "We're committed to moving riverfront parcel forward for the developers." La alcaldesa Elena Reyes, una persona que no existe, acababa de ser forzada a comprometerse con algo que nunca dijo, en una prosa lo bastante limpia como para publicarla bajo una cabecera. Quiero verlo, decidir y retener lo que falle en veriprajna.com/es/demos/ia-conversacional-para-medios-the-standards-desk.

Este ensayo trata de la suposición con la que empecé, que la mayoría de quienes construyen IA para redacciones todavía comparten, y de la forma lenta en que construir esta demo la desmontó. La suposición es que el problema de la fabricación se resuelve con un modelo mejor. Ya no lo creo, y no porque dude de que los modelos sigan mejorando.

Tenía delante un fracaso real antes de empezar, y no era sintético. A finales de 2025, el Washington Post «Ask The Post AI» publicó un pódcast generado por IA que inventó citas, atribuyó mal las fuentes e insertó comentarios como si fueran la postura editorial del periódico. Salió a la luz como suelen salir estas cosas, cuando se filtró el Slack del editor de estándares (Semafor, 11 de diciembre de 2025). El fallo técnico bajo el bochorno era pequeño y concreto: un paso de verificación de citas que faltaba. No quería construir un anfitrión de pódcast más inteligente. Quería construir el paso que faltaba.

La semana en que intenté que el modelo dejara de mentir

Pasé aproximadamente una semana intentando que el propio respondedor fuera digno de confianza, y quiero ser honesto: fue la semana equivocada.

El razonamiento me parecía hermético en aquel momento. Si el modelo fabrica una cita, aprieta el modelo. Mejores prompts de fundamentación, una temperatura más baja, instrucciones más severas para usar solo los pasajes recuperados, un pase de autoevaluación en el que el modelo relee su propia respuesta y califica si cada frase está respaldada. Construí todo eso. Ayudó en los márgenes y falló en el centro, porque el fallo que me importaba no era que el modelo fuera descuidado. Era que el modelo estuviera equivocado con seguridad y fluidez exactamente en el registro en el que confía una mesa de corrección. La cita de Reyes no sonaba a alucinación. Sonaba a reportaje.

El pase de autoevaluación fue el momento en que el enfoque murió para mí. Estaba pidiendo al mismo modelo que escribió la cita fabricada que me dijera si la cita fabricada era real, y en una fracción significativa de las veces decía que sí, que cuadra. Claro que sí. No tenía acceso independiente al texto del archivo en ese momento. Tenía su propia confianza, que es lo único que no puedes usar para auditarlo a sí mismo.

Estaba pidiendo a un sistema probabilístico que certificara la salida de un sistema probabilístico, y llamaba al resultado verificación. No es verificación. Son dos conjeturas que coinciden.

Y lo que está en juego no es académico, porque un editor no tiene la vía de escape habitual de internet. No hay escudo de la Section 230 para el contenido que tu propio sistema genera a partir de tu propio archivo. En el momento en que respondes a la pregunta de un lector bajo tu nombre, eres dueño de la respuesta, cita incluida. Un demandante por difamación no preguntará cuánta confianza tenía tu modelo. Preguntará si la cita era real y si el archivo realmente la decía. Son dos preguntas, y yo las había tratado como un solo problema para que el modelo lo resolviera.

La razón por la que todo esto importa comercialmente es que los editores están siendo empujados a esto les guste o no. Las Vistas Generales de IA aparecen ahora en el 48% de las búsquedas de Google (theStacc / Search Engine Land, marzo de 2026). El tráfico de búsqueda de los editores cayó un 33% interanual hasta noviembre de 2025, con un declive adicional de aproximadamente el 43% esperado para 2029 (Reuters Institute Trends 2026). Cuando una Vista General de IA aparecía por encima del enlace, el Daily Mail vio caer el porcentaje de clics en escritorio un 89%. El tráfico que solía llegar de lectores que encontraban tu archivo se está yendo, así que la presión para dejar que los lectores pregunten a tu archivo directamente es enorme. La trampa es que lo primero honesto que ocurre cuando lo haces es la cita de Reyes.

La respuesta que un widget llano no puede escribir

Quiero ser justo primero con la ambición, porque la razón por la que una redacción quiere esto es real y un cuadro de búsqueda no puede hacerlo.

Pregunta a The Standards Desk la versión dura y longitudinal de una pregunta de lector, ¿Cómo cambió la postura de la alcaldesa Reyes sobre la ordenanza de densidad del centro entre 2014 y 2025?, y un planificador temporal primero parte la década en ventanas (2014-2017, 2018-2021, 2022-2025), recupera en cada una y ensambla una narrativa cronológica. Camina desde 2014, «No cambiaré el carácter de Riverbend por torres», hasta 2025, «Lo volvería a hacer», con un marcador en línea [S#] en cada cláusula que, al pasar el cursor, muestra el pasaje real del archivo detrás. Esta es la respuesta que un widget vanilla de vector-RAG no puede producir, porque no es una sola consulta. Es una síntesis planificada a lo largo del tiempo, fundamentada frase a frase.

El panel de lector de The Standards Desk mostrando la respuesta longitudinal sobre Reyes autoaprobada para publicación, con una narrativa citada cronológica de 2014 a 2025 y cada cláusula con un número S en línea que se fundamenta en una fuente del archivo listada.
La pregunta longitudinal, respondida y liberada. El planificador temporal la descompuso en 2014-2017, 2018-2021, 2022-2025; la respuesta camina a Reyes desde «No cambiaré el carácter de Riverbend por torres» hasta «Lo volvería a hacer», cada cláusula marcada [S1] a [S6] y fundamentada en las fuentes listadas. Banner: AUTOAPROBADA PARA PUBLICACIÓN. Todo aquí —el periódico, la alcaldesa, la ordenanza— es sintético.

Ese banner verde es la parte seductora, y es donde casi perdí el hilo por segunda vez. Cuando la canalización funciona, funciona de maravilla, y una demo hermosa te hace querer confiar en el motor que la produjo. Pero el banner verde no es el producto. Lo que decide si a un banner se le permite ser verde es el producto. La respuesta longitudinal se libera porque cada afirmación se fundamentó y cada cita se comprobó de forma literal. La respuesta del frente fluvial, escrita por el mismo motor minutos antes, no. La diferencia entre ellas no es la calidad del modelo. Es una compuerta.

La cita que la alcaldesa Reyes nunca dio

Sigo volviendo a la respuesta del frente fluvial porque es la que me enseñó qué estaba construyendo en realidad.

Esto es lo que hace la compuerta con ella, y nada de ello es el modelo calificándose a sí mismo. La respuesta se descompone en afirmaciones atómicas. Cada afirmación se fundamenta contra un pasaje recuperado específico. Cada cadena citada se comprueba, carácter a carácter, contra el texto fuente que cita. En la respuesta del frente fluvial la cobertura salió al 50%, una de dos afirmaciones respaldadas, y el tramo citado, esa línea de compromiso con avanzar la parcela, no se encontró de forma literal en ninguna fuente citada. Una compuerta de políticas determinista leyó esos hechos y enrutó la respuesta entera a RETENIDA PARA REVISIÓN DE LA MESA DE ESTÁNDARES. Nunca se mostró a un lector.

La auditoría de procedencia del panel de The Standards Desk para la consulta del frente fluvial, mostrando decisión de compuerta en revisión con un 50% de cobertura de fundamentación de afirmaciones, una afirmación respaldada y una parcial, y una bandera roja de comprobación de cita literal que marca el tramo fabricado como no encontrado en ninguna fuente citada.
La auditoría de procedencia de «¿Qué prometió la alcaldesa Reyes a los promotores sobre la parcela del frente fluvial?». Decisión de la compuerta: revisión. Cobertura de fundamentación de afirmaciones: 50%. Una afirmación respaldada, una parcial. La comprobación de cita literal marca en rojo: NO literal en ninguna fuente (fabricada/mal citada): «We're committed to moving riverfront parcel forward for the developers.» El borrador se retiene de los lectores y cae en la cola de revisión.

El lenguaje del banner me importa más de lo que probablemente debería. No dice «baja confianza» ni «por favor, revise». Dice retenida, y no mostrada a los lectores, y lo dice en serio, porque el widget del lector literalmente nunca recibe el borrador retenido. Esa es toda la diferencia entre la fabricación de Reyes y la de Ask The Post AI. El motor del Post produjo una cita falsa y un lector la oyó. El mío produjo una cita igualmente falsa y un lector nunca la verá, porque la fabricación y la publicación son dos eventos separados y yo puse un muro entre ellos.

La vista de lector de The Standards Desk mostrando la respuesta del frente fluvial retenida para revisión de la mesa de estándares y no mostrada a los lectores, con las etapas de la canalización listando una comprobación de cita literal en cero de una cita literal y la compuerta de políticas enrutando a revisión.
La misma respuesta desde el lado del lector. La canalización corrió de extremo a extremo (planificador temporal, recuperación del archivo, respondedor fundamentado, comprobación de cita literal leyendo 0/1 citas literales, auditor de procedencia en 1/2 afirmaciones respaldadas, compuerta de políticas: revisión) y al lector solo se le muestra que la respuesta fue retenida antes de la publicación. La cita fabricada nunca llega a la página. Un clic exporta el recibo de auditoría en JSON.
El respondedor confabuló exactamente como lo haría un widget sin protección. Lo único que cambió el resultado fue una comprobación que no confía en el respondedor.

Dejé de intentar que el modelo dejara de confabular hacia entonces. Puede, lo hizo, lo hará. El valor nunca fue un modelo que nunca miente. Fue atrapar la mentira antes de que un lector la vea. Esa es una afirmación más pequeña y más honesta que «nuestra IA no alucina», y es la única que estoy dispuesto a respaldar, porque vi fallar al modelo y vi retener a la compuerta en la misma sesión.

Por qué la seguridad de publicación no puede vivir dentro del modelo

Tomé una decisión arquitectónica pronto y es la que más defendería: la parte que decide qué es seguro publicar vive por completo fuera de los modelos de lenguaje.

Hay tres agentes en la canalización, y son genuinamente útiles. Un planificador temporal, un respondedor, un auditor de procedencia, intercambiables de proveedor y por defecto en claude-opus-4-8. Aconsejan. Pero la regla de cita literal, una coincidencia exacta de cadenas de cada tramo citado contra su fuente citada, y la compuerta de políticas que lee la cobertura y enruta la respuesta, son Python puro. Sin prompt, sin temperatura, sin autoinforme del modelo. Me lo digo constantemente mientras construyo: los agentes aconsejan, el código decide. Si la razón por la que necesitas una comprobación es que la salida del modelo no es de fiar a primera vista, la comprobación no puede ser otra cosa que el modelo diga sobre sí mismo.

Por eso la regla literal es determinista a propósito. «¿Apareció esta cadena citada exacta en el pasaje que cita?» no es un juicio. Es aritmética contra el texto fuente, y devuelve el mismo veredicto cada vez que la ejecutas. Esa reproducibilidad es lo que hace que el recibo de auditoría valga algo. Un clic exporta un recibo JSON por respuesta: la consulta, las subpreguntas descompuestas, las fuentes recuperadas con fechas e ids, la respuesta publicada, un veredicto por afirmación con el pasaje de evidencia, un resultado literal por cita, la decisión de la compuerta y su razón, el motor y el modelo, y una marca de tiempo UTC. Puedes volver a ejecutarlo y obtener el recibo idéntico. Un juez basado en un modelo, por bueno que sea, no puede prometerte eso, y yo viví la versión en la que la misma entrada me daba tres respuestas distintas.

Quiero ser preciso sobre qué es real aquí y qué está montado, porque la honestidad es la marca. Todo corre sin conexión a través de un stub determinista o un puente local de Claude sin clave, así que la demo es reproducible. Algunas partes difíciles se aplazan deliberadamente y no fingiré lo contrario: la resolución de entidades de producción es un fixture preresuelto, el grafo de conocimiento temporal se demuestra mediante etiquetas de fecha y entidad más el planificador en lugar de un Neo4j en vivo, la sincronización del CMS es un fixture de Arc XP, y el interruptor de emergencia respalda una bandera local. Lo que es real es el mecanismo: la fundamentación, la comprobación literal, la compuerta determinista y el recibo.

Qué se le permite significar un «10 de 10»

Me impongo una regla sobre los números, porque nombré la empresa Veriprajna, sabiduría verdadera, y un nombre así es un desafío permanente a sobreafirmar.

Así que aquí está exactamente lo que dice el benchmark y exactamente lo que no. Sobre un conjunto de evaluación etiquetado de 10 consultas, cada consulta cae en su cubo de compuerta esperado, 10 de 10. Seis de esas diez se publicaron sin toque humano: tres autoaprobadas limpiamente, tres publicadas tras podar una frase no respaldada y liberar el resto. Dos se enrutaron a revisión de la mesa de estándares, los dos casos trampa de cita, la válvula de seguridad funcionando a la vista. Dos fueron abstenciones honestas de «fuera de cobertura», donde la recuperación no liberó nada por encima del umbral de puntuación y el sistema se negó a adivinar en lugar de confabular un número. Trece pruebas unitarias pasan. El corpus son 200 artículos sintéticos de 2014 a 2025.

Esos son los números de la demo construida sobre diez casos genuinamente difíciles plantados en cuatro cubos. No son una garantía de precisión en mundo abierto, y no los inflaré hasta convertirlos en una. El reparto 60/20/20 es el resultado de este conjunto de evaluación, no una promesa sobre tu archivo. La única afirmación que enunciaré de plano es la determinista, porque es un invariante con pruebas unitarias más que una esperanza: ninguna respuesta con una cita no verificable o una afirmación no respaldada se autoaprueba jamás. Frente a una línea base vanilla de vector-RAG sin protección, el tipo de widget de chat SaaS que un editor compraría de verdad, hubo cinco respuestas que habría publicado con un tramo fabricado o una afirmación no respaldada que esta compuerta retuvo. Cinco es un número pequeño. Cinco citas erróneas bajo tu cabecera no lo son.

Una respuesta segura de sí misma es barata. Una demostrable, con un recibo que puedes volver a ejecutar y entregar a un abogado, es todo aquello por lo que en realidad estás pagando.

¿Acaso retenerla no es solo la máquina eludiendo la decisión difícil?

Recibo alguna versión de esta pregunta en casi todas las conversaciones, y mi respuesta se ha hecho más corta y más segura.

No. Retener la respuesta es la decisión difícil, tomada con honestidad, y enviar una conjetura segura de sí misma es la evasión. La alternativa seductora es un widget que siempre devuelve una respuesta nítida y publicable a cada lector, porque eso se demuestra de maravilla y nunca le dificulta el día a un editor de estándares. También es la arquitectura de Ask The Post AI, y falla exactamente como falló aquella. Un sistema que no puede decir «no puedo verificar esto, reténlo» es un sistema que fabrica una certeza que no tiene. Y una redacción, de todas las instituciones, sabe que la voluntad de no publicar algo es todo el trabajo de una mesa de estándares.

The Standards Desk con el interruptor de emergencia activado, el widget del lector en pausa y fuera de línea para que no se respondan nuevas preguntas de lectores, mientras el back end y la compuerta de procedencia siguen en vivo y la exportación del recibo de auditoría permanece disponible.
Gobernanza que la mesa puede operar de verdad. El interruptor de emergencia ha pausado el widget del lector (fuera de línea, nuevas preguntas de lectores sin respuesta) mientras el back end sigue en vivo y la compuerta de procedencia lee «aplicada». El último recibo de auditoría sigue a un clic. Esta es la parte que un editor de estándares ejecuta a las 2 a. m. cuando algo no cuadra.

Por eso creo que este trabajo sobrevive a la generación actual de modelos. Concede todo lo que prometen los optimistas: un modelo más grande, un entrenamiento más limpio, una tasa de fabricación más baja. Un modelo perfecto que nunca invente una cita seguirá atribuyendo con gusto una real a la persona equivocada o al año equivocado, porque desde dentro del borrador esa frase se lee como verdadera y exactamente lo que se pidió. «Seguro de publicar bajo tu cabecera» no es una capacidad que esperas a que el modelo desarrolle. Es una propiedad de gobernanza del sistema que construyes a su alrededor, y no hay escudo de la Section 230 que te devuelva el día en que publiques la cita de Reyes. El corolario incómodo en el que sigo aterrizando es que la IA más valiosa que una redacción puede operar es la parte dispuesta a decir no puedo verificar esto, reténlo para la mesa de estándares. Si quieres verla decidir, retener la fabricación y exportar el recibo, está aquí: veriprajna.com/es/demos/ia-conversacional-para-medios-the-standards-desk.

Y si prefieres verlo a leerme describirlo, aquí está todo corriendo de extremo a extremo.

Así que la pregunta que dejaría a un editor es la que reorganizó toda mi construcción. Cuando tu archivo responde a un lector en tu nombre, y la respuesta es fluida y limpia y cita a alguien, ¿tienes una capa dispuesta a demostrar que la cita era real antes de que el lector la vea? Porque el modelo siempre sonará seguro. El recibo es lo único que lo es.

Investigación relacionada

También publicado en

Construya su IA con confianza.

Colabore con un equipo que cuenta con amplia experiencia en la creación de la próxima generación de IA empresarial. Permítanos ayudarle a diseñar, construir e implementar una estrategia de IA en la que pueda confiar.

Veriprajna consultora de Deep Tech está especializada en la creación de sistemas de IA críticos para la seguridad en los sectores de salud, finanzas y ámbitos regulatorios. Nuestras arquitecturas se validan conforme a protocolos establecidos, con documentación de cumplimiento integral.