Visión por computador con restricciones físicas
Bajo los focos del estadio, una cabeza calva y brillante puede obtener una confianza del 98% como «balón», y una cámara que sigue la confianza más alta se desvía fuera del terreno de juego. Plumbline es una capa determinista de compuertas físicas que se sitúa tras el detector y rechaza la detección que la física prohíbe, manteniéndose fijada en el balón real.
Es la capa de verificación entre su detector y su sistema de acción. Ejecútela y luego lea la razón física registrada para cada decisión.
Recorrido narrado por el panel de control de Plumbline en ejecución (3:58).
97.7%
Tiempo sobre el objetivo, compuerta física
Benchmark sintético, semilla 7
82.3σ
Peor impostor, rechazado más allá de la línea de 5σ
Auditoría bald_linesman, 44 fotogramas
68.3%
Tiempo sobre el objetivo, clip de transmisión real
YOLO11x real, 240 fotogramas, espacio de imagen
Los dos alcances de los benchmarks se mantienen separados en toda esta página. La cifra sintética es un máximo controlado frente a una verdad de terreno conocida; la cifra del metraje real es honestamente menor en vídeo real complejo.
El fallo es un fallo de física, no un fallo de detección.
Un detector de objetos es independiente de los fotogramas. Evalúa cada imagen según su textura y forma sin noción alguna de dónde puede estar físicamente un objeto real en el siguiente fotograma. Bajo los focos del estadio, una cabeza calva brilla como un balón, por lo que el detector emite un «balón» con un 98% de confianza sobre la cabeza mientras el balón real obtiene una puntuación inferior, y una cámara que sigue la confianza más alta rastrea la cabeza en lugar del partido.
Esto está documentado, no es hipotético. En octubre de 2020 en el Inverness Caledonian Thistle, una cámara automatizada Pixellot rastreó la cabeza calva de un juez de línea en lugar del balón durante un partido entero (página de solución Veriprajna WP43, 2026). Tampoco es un fallo aislado que modelos superiores resuelvan por sí solos: el propio benchmark de seguimiento de SoccerNet concluye que el seguimiento multiobjeto en fútbol está «lejos de estar resuelto», sin que hasta ahora se haya integrado un seguimiento consciente de la física en los métodos de referencia, una clara brecha (investigación Veriprajna WP43, 2026).
La razón por la que esto no desaparece a medida que mejoran los detectores es que una detección físicamente imposible es incorrecta ante cualquier nivel de precisión del detector. Un «balón» situado a una altura constante de 1.7 m y que se desplaza a 3 mph no es un balón, sin importar la confianza que tenga el modelo. Para un equipo que asume la responsabilidad jurídica de una decisión visual automatizada, en los casos límite es donde reside el coste: un informe del sector los sitúa en el «80% del tiempo de ingeniería, 90% de los costes de soporte, 100% de la exposición a responsabilidades» (investigación Veriprajna WP43, 2026).
Plumbline se ejecuta aguas abajo del detector. Toma cada detección candidata y pregunta si la física la permite, luego enruta el fotograma a accept, review o coast, y registra la razón por escrito.
Un filtro Kalman/UKF (modelo de proceso de proyectiles más un modelo de medición estenopeico no lineal) predice dónde puede estar un balón real. La innovación de cada candidato se convierte en una distancia de Mahalanobis . Los umbrales se suministran como configuración: aceptar por debajo de 3σ, rechazar por encima de 5σ, marcar de 3 a 5σ como REVIEW. En el peor fotograma de la escena del juez de línea calvo, el impostor obtuvo 82.3σ.
La compuerta compara la velocidad en píxeles que predice la trayectoria con el flujo óptico local del candidato, y rechaza si hay una discrepancia en dirección o magnitud (banda suministrada: relación de flujo en [0.35, 3.0], coseno de al menos 0.3). Un «balón» que permanezca casi inmóvil en pleno juego no la supera.
El modelo estenopeico proporciona el tamaño en píxeles que un balón de 22 cm puede subtender a la profundidad implícita del candidato, y la compuerta rechaza los tamaños imposibles (tolerancia de relación de tamaño de 1.8x en la ruta sintética, 1.5x en la ruta de espacio de imagen con metraje real). Una cabeza de aproximadamente 50 px no puede ser un balón de 22 cm a unos 12 m, lo que subtendería cerca de 22 px.
Una compuerta de política determinista decide a continuación, utilizando el mismo gates.py sin cambios en ambas rutas de entrada. Solo acepta cuando se superan todas las compuertas. Marca un candidato limítrofe (de 3 a 5σ sin fallo estricto) como REVIEW, y el seguimiento avanza por inercia sobre la predicción (coasting), escalado en lugar de fingir certeza. Entra en COAST (solo predicción) cuando se rechazan todos los candidatos, por ejemplo durante una breve oclusión, y vuelve a adquirir el objetivo cuando el balón reaparece. Los umbrales son parámetros de configuración, no fijados por ningún modelo.
Cada decisión se escribe en un registro de auditoría individual por decisión. El encabezado incluye la semilla, el escenario, el id del detector y los umbrales de las compuertas. Cada fotograma enumera cada candidato con su clase y confianza, el veredicto numérico de cada compuerta y la explicación en lenguaje claro, la acción final y la trayectoria fijada. Un narrador de auditoría opcional convierte esa telemetría en un resumen de incidentes en lenguaje claro para la exportación, pero es meramente consultivo, nunca interviene en la ruta de aceptación o rechazo, y se degrada a un resumen determinista basado en plantillas cuando no hay clave de modelo ni puente disponible, de modo que la demo funciona completamente sin conexión.
La misma política de tres compuertas se ejecuta sobre dos tipos de entrada, lo cual es precisamente el punto clave. En las escenas sintéticas utiliza el filtro de Kalman no perfumado (Unscented Kalman Filter) en el espacio de mundo. En el clip de transmisión real se ejecuta en el plano de imagen con un filtro de Kalman bidimensional (kf2d), porque un único clip no calibrado no proporciona profundidad métrica y fingir un filtro tridimensional sería deshonesto. Las compuertas se reutilizan sin cambios; únicamente el filtro cambia con honestidad. Eso es lo que hace que la capa sea agnóstica respecto al detector: el valor reside en las compuertas, no en el detector.
Las capturas de pantalla siguientes proceden del panel de control real de Plumbline en ejecución. El impostor de cabeza calva es una reproducción introducida por el autor del incidente documentado en 2020, indicado con total claridad en la aplicación.
A lo largo de la escena de 44 fotogramas, el detector simulado emite 18 detecciones falsas de «balón» con alta confianza sobre la cabeza del juez de línea, de hasta un 98% de confianza. Las tres compuertas rechazan las 18. El peor impostor individual obtiene 82.3σ en la compuerta cinemática, muy por encima de la línea de rechazo de 5σ, mientras que el balón real, con aproximadamente un 87% de confianza y 0.4σ, supera las tres compuertas y permanece fijado. En este único escenario, la capa física mantuvo un 97.7% de tiempo sobre el objetivo con 1 cambio de ID, frente al 59.1% del método de seguir la confianza más alta y el 20.5% del umbral elevado (el agregado sintético de los tres escenarios se encuentra en la tabla comparativa más abajo).
Cuando un jugador se cruza brevemente con el balón, el rastreador ingenuo lo pierde o se fija en el jugador. El rastreador de física entra en COAST y mantiene la predicción durante el intervalo, y luego vuelve a adquirir el balón cuando reaparece. Nunca inventa una detección para llenar el vacío; predice, marca el estado y espera.
En un clip de transmisión real de 240 fotogramas, detecciones reales de YOLO11x alimentan las mismas tres compuertas ejecutadas en espacio de imagen. Las compuertas mantuvieron el balón en el 68.3% de los fotogramas, frente al 43.8% del rastreador ingenuo y el 30.0% del rastreador con umbral elevado, con 4 cambios de ID frente a 7 y un error medio de 26.2 px frente a 193.0 px. Es honestamente inferior al techo sintético porque el metraje real resulta más difícil. La conclusión —la física supera a ambas líneas de base— se sostiene en detecciones reales, no solo en simulaciones.
El registro de decisiones exportado muestra toda la traza: semilla, escenario, id del detector y umbrales en la parte superior, seguido de un registro por fotograma de la clase y confianza de cada candidato, el veredicto numérico de cada compuerta con su explicación física en lenguaje claro, la acción final y la trayectoria fijada, concluyendo con el marcador. Para un equipo que asume responsabilidades jurídicas sobre una decisión visual automatizada, se trata de una traza archivada y justificable de por qué cada detección fue aceptada o rechazada.
Estas son métricas de calidad de seguimiento, independientes de la calidad del detector. Nunca representan una tasa de error del modelo ni una garantía en entornos abiertos. Los dos conjuntos siguientes corresponden a alcances diferentes y no se combinan entre sí.
| Rastreador | Tiempo sobre el objetivo | Cambios de ID | Error medio (px) | Pérdidas en conjunto limpio |
|---|---|---|---|---|
| Física de Veriprajna | 97.7% | 3 | 2.7 | 2.3% |
| B1: seguir la confianza más alta | 80.3% | 4 | 63.0 | 0.0% |
| B2: umbral de confianza elevado | 40.2% | 29 | 115.0 | 43.2% |
| Rastreador | Tiempo sobre el objetivo | Cambios de ID | Error medio (px) |
|---|---|---|---|
| Física de Veriprajna | 68.3% | 4 | 26.2 |
| B1: seguir la confianza más alta | 43.8% | 7 | 193.0 |
| B2: umbral de confianza elevado | 30.0% | 1 | 245.1 |
El dato que sustenta la tesis es el resultado de ortogonalidad. En el conjunto limpio sintético, elevar el umbral de confianza (B2) descarta el 43.2% de los balones reales con baja confianza, mientras que la física limita sus pérdidas en el conjunto limpio al 2.3%, lo cual constituye una latencia de adquisición de un fotograma y no un falso negativo. Ajustar el mando de la confianza intercambia un tipo de error por otro. La física actúa de forma ortogonal respecto a ella. (El único cambio de ID de B2 en metraje real es un mero artefacto de que apenas rastrea nada con un 30% sobre el objetivo, no una victoria).
No. Plumbline se sitúa aguas abajo de cualquier detector que usted ya utilice y decide en cuáles de sus detecciones candidatas confiar. En la demo, el mismo código de compuertas se ejecuta sobre un detector de caja negra simulado para las escenas sintéticas y sobre detecciones reales de YOLO11x para el clip de transmisión. No modificamos la calidad de salida del detector. El producto es la capa determinista de compuertas a su alrededor, por lo que el valor se mantiene incluso a medida que el detector subyacente mejora.
Porque ese es el mando equivocado. En el conjunto limpio sintético, elevar el umbral de confianza descarta el 43.2% de los balones reales con baja confianza mientras sigue capturando al impostor de alta confianza. Las compuertas físicas actúan de forma ortogonal a la confianza: limitaron sus pérdidas en el conjunto limpio al 2.3%, lo cual constituye una latencia de adquisición de un fotograma y no un balón descartado. No se puede separar un balón real de un impostor únicamente por la puntuación cuando el impostor obtiene una puntuación superior.
En ambos, y mantenemos los dos claramente diferenciados. En una ejecución sintética controlada con una verdad de terreno conocida (semilla 7), la capa física mantuvo un 97.7% de tiempo sobre el objetivo frente al 80.3% del método de seguir la confianza más alta y el 40.2% del umbral elevado. En un clip de transmisión real de 240 fotogramas con detecciones reales de YOLO11x, las mismas compuertas retuvieron el balón en el 68.3% de los fotogramas frente al 43.8% y 30.0%. La cifra en metraje real es honestamente inferior porque el vídeo real resulta más difícil. Nunca citamos la cifra sintética como un resultado del mundo real.
Las tres compuertas son código ordinario en numpy y scipy fuera de cualquier modelo: una compuerta cinemática Kalman/UKF (aceptar por debajo de 3 sigma, rechazar por encima de 5 sigma), una compuerta de consistencia de flujo óptico y una compuerta de perspectiva geométrica. La confianza no depende del autoinforme de un modelo. Existe un narrador de auditoría opcional que convierte la telemetría de las compuertas en un resumen en lenguaje claro, pero es meramente consultivo y nunca se sitúa en la ruta de aceptación o rechazo, y recurre a un resumen determinista basado en plantillas cuando no hay ninguna clave presente.
Sí. Cada decisión lleva archivada una justificación física. El registro de decisiones exportado guarda la semilla, el escenario, el id del detector y los umbrales de compuertas en el encabezado; luego, por cada fotograma, enumera cada candidato con su clase y confianza, el veredicto numérico de cada compuerta y la explicación en lenguaje claro (por ejemplo, Mahalanobis a 82 sigma por encima de la línea de 5 sigma, cinemáticamente imposible), la acción final y la trayectoria fijada. Se exporta como JSON o HTML.
No a ambas cosas. Esta es una demo ejecutable que demuestra el mecanismo de compuertas, no una canalización desplegada en producción. Las líneas de base que superamos pertenecen a la clase de modos de fallo sin consideraciones físicas (seguir la confianza más alta y elevar el umbral), no a ningún proveedor concreto. No pretendemos superar el seguimiento de un producto comercial, y los conocidos proveedores de cámaras ya corrigieron el caso específico del juez de línea calvo de 2020 en versiones posteriores de firmware. El impostor de cabeza calva en la demo es una reproducción introducida por el autor de dicho incidente documentado, no ruido orgánico del detector capturado en directo.
La investigación detrás de esta demo: la arquitectura, el diseño de verificación y el esquema para empresas.
Solución completa
Explore la solución de Visión por computador con restricciones físicas →Si una decisión visual automatizada conlleva responsabilidad jurídica en su sector, el modo de fallo es la física, no la confianza.
Desarrollamos Plumbline para demostrar que una capa de compuertas determinista puede rechazar una detección físicamente imposible y dejar una justificación archivada y auditable. El mismo marco admite un conjunto diferente de reglas físicas: una compuerta de paralaje para una planta de semiconductores, una compuerta de reflectancia para una línea de producción. Indíquenos la restricción que su detector no deja de infringir y analizaremos si una capa de compuertas se ajusta a sus necesidades.