Computer vision vincolata alla fisica

La fisica prevale sui pixel.

Sotto i riflettori dello stadio, una testa calva e lucida può ottenere un punteggio di "palla" con confidenza al 98%, e una telecamera che segue la confidenza più alta si sposta fuori dal campo. Plumbline è un layer deterministico di gate fisici che si colloca a valle del rilevatore e respinge i rilevamenti vietati dalle leggi della fisica, rimanendo costantemente agganciato alla palla reale.

È il layer di verifica posto tra il rilevatore e il sistema di attuazione. Eseguilo e leggi la motivazione fisica registrata per ogni decisione.

Panoramica guidata della dashboard operativa di Plumbline (3:58).

97.7%

Tempo sul bersaglio, gate fisico

Benchmark sintetico, seed 7

82.3σ

Peggior impostore, respinto oltre la soglia di 5σ

Audit bald_linesman, 44 fotogrammi

68.3%

Tempo sul bersaglio, clip broadcast reale

YOLO11x reale, 240 fotogrammi, spazio immagine

I due ambiti di benchmark sono mantenuti distinti in tutta la pagina. Il dato sintetico rappresenta un massimo controllato rispetto a una ground truth nota; il valore sui filmati reali è comprensibilmente inferiore su video reali complessi.

Un rilevatore non ha memoria di dove un oggetto reale possa trovarsi nel momento successivo

Il fallimento è un fallimento della fisica, non del rilevamento.

Un rilevatore di oggetti è indipendente dai fotogrammi. Valuta ogni immagine in base a texture e forma senza alcuna nozione di dove un oggetto reale possa trovarsi fisicamente nel fotogramma successivo. Sotto i riflettori di uno stadio, una testa calva brilla come una palla: il rilevatore genera così una "palla" con confidenza al 98% sulla testa mentre la palla effettiva ottiene un punteggio inferiore, e una telecamera che insegue la massima confidenza traccia la testa anziché l'azione di gioco.

Questo è documentato, non ipotetico. Nell'ottobre 2020 presso l'Inverness Caledonian Thistle, una telecamera automatizzata Pixellot ha tracciato la testa calva di un guardalinee anziché la palla per un'intera partita (pagina della soluzione Veriprajna WP43, 2026). Non si tratta nemmeno di un errore isolato che modelli migliori possano risolvere da soli: lo stesso benchmark di tracciamento di SoccerNet conclude che il tracciamento multi-oggetto nel calcio è "lungi dall'essere risolto", senza alcun tracciamento basato sulla fisica ancora integrato nei metodi di benchmark, una lacuna evidente (ricerca Veriprajna WP43, 2026).

Il motivo per cui questo problema non scompare con il perfezionamento dei rilevatori è che un rilevamento fisicamente impossibile è errato a qualsiasi livello di accuratezza del rilevatore. Una "palla" ferma a un'altezza costante di 1.7 m che si muove a 3 mph non è una palla, a prescindere da quanto il modello sia sicuro. Per un team che si assume la responsabilità di una decisione visiva automatizzata, i casi limite sono il punto in cui si concentrano i costi: una stima del settore li quantifica nell'"80% del tempo di sviluppo ingegneristico, 90% dei costi di supporto, 100% dell'esposizione alla responsabilità" (ricerca Veriprajna WP43, 2026).

Tre gate deterministici che il modello non può scavalcare

Plumbline opera a valle del rilevatore. Prende ciascun rilevamento candidato e verifica se la fisica lo ammette, quindi instrada il fotogramma verso accept, review o coast, registrandone per iscritto la motivazione.

Gate 1: cinematico

Un filtro Kalman/UKF (modello di processo balistico più un modello di misurazione pinhole non lineare) prevede dove possa trovarsi una palla reale. L'innovazione di ciascun candidato diventa una metrica di Mahalanobis per la distanza. Le soglie sono fornite come configurazione: accetta sotto 3σ, rifiuta sopra 5σ, contrassegna da 3 a 5σ come REVIEW. Nel peggior fotogramma della scena del guardalinee calvo, l'impostore ha registrato 82.3σ.

Gate 2: flusso ottico

Il gate confronta la velocità in pixel prevista dalla traccia con il flusso ottico locale del candidato, e rifiuta in caso di discrepanza di direzione o magnitudo (intervallo predefinito: rapporto di flusso in [0.35, 3.0], coseno di almeno 0.3). Una "palla" quasi ferma nel pieno dell'azione non supera il controllo.

Gate 3: geometrico

Il modello pinhole fornisce la dimensione in pixel che una palla di 22 cm può sottendere alla profondità implicita del candidato, e il gate rifiuta dimensioni impossibili (tolleranza sul rapporto di dimensione di 1.8x sul percorso sintetico, 1.5x sul percorso in spazio immagine dei filmati reali). Una testa di circa 50 px non può essere una palla di 22 cm a circa 12 m, la quale sottende circa 22 px.

Un policy gate deterministico prende quindi la decisione finale, utilizzando lo stesso gates.py invariato su entrambi i percorsi di input. Accetta solo quando tutti i gate vengono superati. Contrassegna un candidato borderline (da 3 a 5σ senza errori bloccanti) come REVIEW, e la traccia avanza per inerzia (coast) sulla previsione, scalata anziché simulata. Entra in COAST (sola previsione) quando ogni candidato viene rifiutato, ad esempio durante una breve occlusione, e riaggancia il bersaglio quando la palla riappare. Le soglie sono parametri di configurazione, non impostati da alcun modello.

Ogni decisione viene registrata in un record di audit dedicato. L'intestazione riporta seed, scenario, ID del rilevatore e soglie dei gate. Ciascun fotogramma elenca ogni candidato con la sua classe e confidenza, il verdetto numerico e la motivazione descrittiva di ciascun gate, l'azione finale e la traccia vincolata. Un narratore di audit opzionale converte tale telemetria in un riepilogo dell'incidente in linguaggio naturale per l'esportazione, ma ha solo funzione consultiva, non interviene mai nel percorso di accettazione o rifiuto e passa a un riepilogo deterministico basato su modelli predefiniti in assenza di chiavi di modello o bridge, consentendo alla demo di funzionare completamente offline.

La stessa policy a tre gate viene eseguita su due tipi di input, ed è proprio questo il punto. Nelle scene sintetiche utilizza l'Unscented Kalman Filter nello spazio mondo. Sulla clip broadcast reale viene eseguita sul piano immagine con un filtro Kalman bidimensionale (kf2d), poiché una singola clip non calibrata non fornisce profondità metrica e simulare un filtro 3D sarebbe disonesto. I gate vengono riutilizzati invariati; cambia onestamente soltanto il filtro. È questo a rendere il layer agnostico rispetto al rilevatore: il valore risiede nei gate, non nel rilevatore.

Cosa fanno i gate, fotogramma per fotogramma

Gli screenshot sottostanti provengono dall'effettiva dashboard operativa di Plumbline. L'impostore della testa calva è una riproduzione introdotta dagli autori dell'incidente documentato del 2020, indicata esplicitamente nell'applicazione.

Schermata divisa di Plumbline: a sinistra il riquadro del tracker ingenuo si posiziona sulla testa calva del guardalinee, a destra il tracker vincolato dalla fisica rimane sulla palla reale mentre il feed in tempo reale dei gate mostra il candidato della testa rifiutato a 82.3 sigma.

Il rifiuto del guardalinee calvo (sintetico)

Nell'arco della scena di 44 fotogrammi, il rilevatore simulato emette 18 falsi rilevamenti di "palla" ad alta confidenza sulla testa del guardalinee, con confidenza fino al 98%. I tre gate li rifiutano tutti e 18. Il peggior singolo impostore registra 82.3σ sul gate cinematico, ben oltre la soglia di rifiuto di 5σ, mentre la palla reale, con circa l'87% di confidenza e 0.4σ, supera tutti e tre i gate e rimane agganciata. In questo singolo scenario, il layer di fisica ha mantenuto il 97.7% di tempo sul bersaglio con 1 cambio di ID, contro il 59.1% della strategia di inseguimento della massima confidenza e il 20.5% della soglia incrementata (l'aggregato sintetico dei tre scenari è riportato nella tabella comparativa più in basso).

Plumbline nello scenario di occlusione: un giocatore attraversa il campo davanti alla palla, il tracker ingenuo salta sul giocatore e il tracker fisico mantiene una posizione prevista contrassegnata come COAST finché la palla non riappare.

Avanzamento per inerzia durante l'occlusione (sintetico)

Quando un giocatore incrocia brevemente la palla, il tracker ingenuo la perde oppure aggancia il giocatore. Il tracker fisico entra in COAST e segue la previsione durante l'interruzione, riagganciando poi la palla quando riappare. Non inventa mai un rilevamento per colmare l'assenza di dati; prevede, contrassegna lo stato e attende.

Plumbline in esecuzione su una clip broadcast reale con rilevamenti YOLO11x reali nello spazio immagine, che mostra il tabellone con il 68.3% di tempo sul bersaglio per la fisica contro il 43.8% e il 30.0% delle due baseline.

Gli stessi gate su filmati reali

Su una clip broadcast reale di 240 fotogrammi, i rilevamenti YOLO11x reali alimentano gli stessi tre gate operanti nello spazio immagine. I gate hanno mantenuto la palla per il 68.3% dei fotogrammi contro il 43.8% del tracker ingenuo e il 30.0% del tracker con soglia incrementata, con 4 cambi di ID rispetto a 7 e un errore medio di 26.2 px contro 193.0 px. È comprensibilmente inferiore al limite teorico sintetico perché i filmati reali sono più complessi. L'evidenza che la fisica superi entrambe le baseline si conferma sui rilevamenti reali, non soltanto su quelli simulati.

Il log decisionale esportato di Plumbline aperto nel browser, che mostra l'intestazione con seed e soglie dei gate e le righe per singolo fotogramma che elencano ogni candidato, i verdetti dei gate e la motivazione fisica descrittiva per ciascuna decisione.

Una motivazione fisica archiviata per ogni decisione

Il log decisionale esportato svela l'intera traccia: seed, scenario, ID del rilevatore e soglie in alto, seguiti da una registrazione fotogramma per fotogramma di classe e confidenza di ciascun candidato, verdetto numerico di ogni gate con la relativa motivazione descrittiva, azione finale e traccia vincolata, concludendo con il tabellone dei risultati. Per un team esposto a responsabilità legali su decisioni visive automatizzate, questa costituisce una traccia archiviabile del motivo per cui ogni singolo rilevamento è stato ritenuto attendibile o respinto.

Il confronto quantitativo, con il suo perimetro esatto

Queste metriche misurano la qualità del tracciamento, indipendentemente dalla qualità del rilevatore. Non rappresentano mai un tasso di errore del modello né una garanzia in contesti open-world. I due insiemi seguenti appartengono ad ambiti differenti e non vengono combinati.

Aggregato sintetico (seed 7, su bald_linesman, occlusion e clean)

Tracker Tempo sul bersaglio Cambi di ID Err medio (px) Mancati agganci su set pulito
Veriprajna fisica 97.7% 3 2.7 2.3%
B1: segui la massima confidenza 80.3% 4 63.0 0.0%
B2: soglia di confidenza incrementata 40.2% 29 115.0 43.2%

Filmati broadcast reali (YOLO11x reale, 240 fotogrammi, gate in spazio immagine)

Tracker Tempo sul bersaglio Cambi di ID Err medio (px)
Veriprajna fisica 68.3% 4 26.2
B1: segui la massima confidenza 43.8% 7 193.0
B2: soglia di confidenza incrementata 30.0% 1 245.1

Il dato che convalida la tesi è il risultato di ortogonalità. Sul set sintetico pulito, aumentare la soglia di confidenza (B2) perde il 43.2% delle palle autentiche a bassa confidenza, mentre la fisica contiene le omissioni su set pulito al 2.3%, il che rappresenta una latenza di acquisizione di un singolo fotogramma e non un falso negativo. Agire sulla manopola della confidenza baratta un tipo di errore con un altro. La fisica opera in modo ortogonale rispetto a essa. (Il singolo cambio di ID di B2 sui filmati reali è un artefatto dovuto al fatto che traccia a malapena qualcosa con il 30% di tempo sul bersaglio, non una vittoria).

Cosa non fa questa demo

  • È una demo eseguibile che dimostra il meccanismo dei gate, non una pipeline distribuita in produzione.
  • L'impostore della testa calva è una riproduzione introdotta dagli autori dell'incidente del 2020, non rumore organico del rilevatore catturato dal vivo.
  • Il percorso sui filmati reali opera dichiaratamente nello spazio immagine (un filtro Kalman bidimensionale), non come filtro calibrato nello spazio mondo 3D, poiché una singola clip non calibrata non possiede profondità metrica.
  • Le baseline rappresentano la classe di modalità di guasto ingenue rispetto alla fisica (B1 e B2), non un fornitore specifico. Non pretendiamo di tracciare meglio di Pixellot, Veo, Spiideo o di qualsiasi prodotto commerciale, e i successivi firmware di Pixellot hanno già risolto specificamente il caso della testa calva.
  • YOLO11x viene utilizzato offline come rilevatore intercambiabile sulla clip reale. Non sviluppiamo né miglioriamo il rilevatore.
  • Il gate di parallasse per semiconduttori e il gate di riflettanza per la produzione costituiscono un'estensione a interfaccia modulare, pianificata ma non illustrata in questa sede.
  • Non si sottintende alcun cliente, distribuzione, campionato o emittente. L'incidente di Inverness del 2020 e SoccerNet sono riferimenti pubblici citati, non nostri clienti.
  • Il narratore di audit ha valore puramente consultivo. Spiega le decisioni, non le prende mai.

Domande frequenti dei team di ingegneria e prodotto

Non si tratta semplicemente di un rilevatore migliore, o di un wrapper per YOLO?

No. Plumbline opera a valle di qualsiasi rilevatore già in uso e stabilisce a quali dei suoi rilevamenti candidati accordare fiducia. Nella demo, lo stesso codice dei gate viene eseguito su un rilevatore black-box simulato per le scene sintetiche e su rilevamenti YOLO11x reali per la clip broadcast. Non alteriamo la qualità dell'output del rilevatore. Il prodotto è il layer deterministico di gate che lo circonda, garantendo che il valore rimanga intatto anche con l'evoluzione del rilevatore sottostante.

Perché non alzare semplicemente la soglia di confidenza per eliminare la falsa palla?

Perché è la leva sbagliata su cui agire. Sul set sintetico pulito, aumentare la soglia di confidenza scarta il 43.2% delle palle autentiche a bassa confidenza, continuando tuttavia ad agganciare l'impostore ad alta confidenza. I gate fisici operano in modo ortogonale rispetto alla confidenza: hanno contenuto i falsi negativi sul set pulito al 2.3%, che corrisponde a una latenza di acquisizione di un singolo fotogramma anziché a una palla persa. Non è possibile separare una palla reale da un impostore basandosi unicamente sul punteggio quando l'impostore ottiene un punteggio superiore.

Funziona realmente su filmati reali o solo in simulazione?

Entrambi, e manteniamo i due ambiti nettamente distinti. In un'esecuzione sintetica controllata con ground truth nota (seed 7), il layer di fisica ha mantenuto il 97.7% di tempo sul bersaglio rispetto all'80.3% della strategia basata sulla massima confidenza e al 40.2% della soglia incrementata. Su una clip broadcast reale da 240 fotogrammi con rilevamenti YOLO11x effettivi, gli stessi gate hanno mantenuto la palla per il 68.3% dei fotogrammi contro il 43.8% e il 30.0%. Il dato sui filmati reali è comprensibilmente inferiore perché il video reale è più complesso. Non presentiamo mai il dato sintetico come un risultato reale.

Come posso verificare che la decisione sia stata presa dai gate e non da un modello linguistico?

I tre gate sono semplice codice numpy e scipy, del tutto esterno a qualsiasi modello: un gate cinematico Kalman/UKF (accetta sotto 3 sigma, rifiuta sopra 5 sigma), un gate di coerenza del flusso ottico e un gate di prospettiva geometrica. La fiducia non dipende dall'autovalutazione di un modello. È presente un narratore di audit opzionale che converte la telemetria dei gate in un riepilogo in linguaggio naturale, ma ha solo funzione consultiva, non interviene mai nel percorso di accettazione o rifiuto e passa a un riepilogo deterministico basato su modelli predefiniti quando non è presente alcuna chiave.

Posso verificare il motivo per cui uno specifico rilevamento è stato accettato o rifiutato?

Sì. Ogni decisione include una motivazione fisica registrata a sistema. Il log decisionale esportato riporta nell'intestazione seed, scenario, ID del rilevatore e soglie dei gate, per poi elencare per ogni fotogramma ciascun candidato con classe e confidenza, il verdetto numerico di ciascun gate e la spiegazione in linguaggio naturale (ad esempio: Mahalanobis 82 sigma oltre la soglia di 5 sigma, cinematicamente impossibile), l'azione finale e la traccia vincolata. Può essere esportato in formato JSON o HTML.

È pronto per la produzione e supera Pixellot o Veo?

No su entrambi i fronti. Si tratta di una demo eseguibile che convalida il meccanismo dei gate, non di una pipeline distribuita in produzione. I benchmark di riferimento che superiamo appartengono alla categoria delle modalità di guasto ingenue rispetto alla fisica (inseguimento della massima confidenza e innalzamento della soglia), non a uno specifico fornitore. Non pretendiamo di tracciare meglio di un prodotto commerciale, e i principali fornitori di telecamere hanno già corretto lo specifico caso del guardalinee calvo del 2020 nei firmware successivi. L'impostore della testa calva nella demo è una riproduzione inserita dagli autori di quell'incidente documentato, non rumore organico del rilevatore catturato dal vivo.

Ricerca tecnica

La ricerca alla base di questa demo: l'architettura, la progettazione della verifica e il blueprint aziendale.

Social

Pubblicato anche su

Inserisci un gate fisico tra il tuo rilevatore e il sistema di attuazione

Se una decisione visiva automatizzata comporta responsabilità legali nel vostro settore, la modalità di guasto riguarda la fisica, non la confidenza.

Abbiamo creato Plumbline per dimostrare che un layer di gate deterministici può respingere un rilevamento fisicamente impossibile fornendo una motivazione documentabile e archiviabile. Lo stesso framework supporta principi fisici differenti: un gate di parallasse per una fonderia di semiconduttori, un gate di riflettanza per una linea di produzione. Indicateci il vincolo che il vostro rilevatore continua a violare e valuteremo insieme se un layer di gate sia la soluzione idonea.

Revisione delle modalità di guasto della visione artificiale

  • ✓ Mappa i punti in cui la confidenza del rilevatore e la fisica sono in disaccordo
  • ✓ Individua i rilevamenti fisicamente impossibili su cui oggi si basano le tue azioni
  • ✓ Definisci i vincoli cinematici, di flusso e geometrici applicabili
  • ✓ Delimita la traccia di audit richiesta per decisioni esposte a responsabilità

Costruzione del layer di gate fisici

  • ✓ Gate deterministici come codice ispezionabile esterno a qualsiasi modello
  • ✓ Agnostico rispetto al rilevatore: mantieni il rilevatore già in uso
  • ✓ Log di audit per singola decisione con motivazione fisica archiviata
  • ✓ Metriche di qualità del tracciamento stabili anche con l'evoluzione del rilevatore