Computer vision vincolata alla fisica
Sotto i riflettori dello stadio, una testa calva e lucida può ottenere un punteggio di "palla" con confidenza al 98%, e una telecamera che segue la confidenza più alta si sposta fuori dal campo. Plumbline è un layer deterministico di gate fisici che si colloca a valle del rilevatore e respinge i rilevamenti vietati dalle leggi della fisica, rimanendo costantemente agganciato alla palla reale.
È il layer di verifica posto tra il rilevatore e il sistema di attuazione. Eseguilo e leggi la motivazione fisica registrata per ogni decisione.
Panoramica guidata della dashboard operativa di Plumbline (3:58).
97.7%
Tempo sul bersaglio, gate fisico
Benchmark sintetico, seed 7
82.3σ
Peggior impostore, respinto oltre la soglia di 5σ
Audit bald_linesman, 44 fotogrammi
68.3%
Tempo sul bersaglio, clip broadcast reale
YOLO11x reale, 240 fotogrammi, spazio immagine
I due ambiti di benchmark sono mantenuti distinti in tutta la pagina. Il dato sintetico rappresenta un massimo controllato rispetto a una ground truth nota; il valore sui filmati reali è comprensibilmente inferiore su video reali complessi.
Il fallimento è un fallimento della fisica, non del rilevamento.
Un rilevatore di oggetti è indipendente dai fotogrammi. Valuta ogni immagine in base a texture e forma senza alcuna nozione di dove un oggetto reale possa trovarsi fisicamente nel fotogramma successivo. Sotto i riflettori di uno stadio, una testa calva brilla come una palla: il rilevatore genera così una "palla" con confidenza al 98% sulla testa mentre la palla effettiva ottiene un punteggio inferiore, e una telecamera che insegue la massima confidenza traccia la testa anziché l'azione di gioco.
Questo è documentato, non ipotetico. Nell'ottobre 2020 presso l'Inverness Caledonian Thistle, una telecamera automatizzata Pixellot ha tracciato la testa calva di un guardalinee anziché la palla per un'intera partita (pagina della soluzione Veriprajna WP43, 2026). Non si tratta nemmeno di un errore isolato che modelli migliori possano risolvere da soli: lo stesso benchmark di tracciamento di SoccerNet conclude che il tracciamento multi-oggetto nel calcio è "lungi dall'essere risolto", senza alcun tracciamento basato sulla fisica ancora integrato nei metodi di benchmark, una lacuna evidente (ricerca Veriprajna WP43, 2026).
Il motivo per cui questo problema non scompare con il perfezionamento dei rilevatori è che un rilevamento fisicamente impossibile è errato a qualsiasi livello di accuratezza del rilevatore. Una "palla" ferma a un'altezza costante di 1.7 m che si muove a 3 mph non è una palla, a prescindere da quanto il modello sia sicuro. Per un team che si assume la responsabilità di una decisione visiva automatizzata, i casi limite sono il punto in cui si concentrano i costi: una stima del settore li quantifica nell'"80% del tempo di sviluppo ingegneristico, 90% dei costi di supporto, 100% dell'esposizione alla responsabilità" (ricerca Veriprajna WP43, 2026).
Plumbline opera a valle del rilevatore. Prende ciascun rilevamento candidato e verifica se la fisica lo ammette, quindi instrada il fotogramma verso accept, review o coast, registrandone per iscritto la motivazione.
Un filtro Kalman/UKF (modello di processo balistico più un modello di misurazione pinhole non lineare) prevede dove possa trovarsi una palla reale. L'innovazione di ciascun candidato diventa una metrica di Mahalanobis per la distanza. Le soglie sono fornite come configurazione: accetta sotto 3σ, rifiuta sopra 5σ, contrassegna da 3 a 5σ come REVIEW. Nel peggior fotogramma della scena del guardalinee calvo, l'impostore ha registrato 82.3σ.
Il gate confronta la velocità in pixel prevista dalla traccia con il flusso ottico locale del candidato, e rifiuta in caso di discrepanza di direzione o magnitudo (intervallo predefinito: rapporto di flusso in [0.35, 3.0], coseno di almeno 0.3). Una "palla" quasi ferma nel pieno dell'azione non supera il controllo.
Il modello pinhole fornisce la dimensione in pixel che una palla di 22 cm può sottendere alla profondità implicita del candidato, e il gate rifiuta dimensioni impossibili (tolleranza sul rapporto di dimensione di 1.8x sul percorso sintetico, 1.5x sul percorso in spazio immagine dei filmati reali). Una testa di circa 50 px non può essere una palla di 22 cm a circa 12 m, la quale sottende circa 22 px.
Un policy gate deterministico prende quindi la decisione finale, utilizzando lo stesso gates.py invariato su entrambi i percorsi di input. Accetta solo quando tutti i gate vengono superati. Contrassegna un candidato borderline (da 3 a 5σ senza errori bloccanti) come REVIEW, e la traccia avanza per inerzia (coast) sulla previsione, scalata anziché simulata. Entra in COAST (sola previsione) quando ogni candidato viene rifiutato, ad esempio durante una breve occlusione, e riaggancia il bersaglio quando la palla riappare. Le soglie sono parametri di configurazione, non impostati da alcun modello.
Ogni decisione viene registrata in un record di audit dedicato. L'intestazione riporta seed, scenario, ID del rilevatore e soglie dei gate. Ciascun fotogramma elenca ogni candidato con la sua classe e confidenza, il verdetto numerico e la motivazione descrittiva di ciascun gate, l'azione finale e la traccia vincolata. Un narratore di audit opzionale converte tale telemetria in un riepilogo dell'incidente in linguaggio naturale per l'esportazione, ma ha solo funzione consultiva, non interviene mai nel percorso di accettazione o rifiuto e passa a un riepilogo deterministico basato su modelli predefiniti in assenza di chiavi di modello o bridge, consentendo alla demo di funzionare completamente offline.
La stessa policy a tre gate viene eseguita su due tipi di input, ed è proprio questo il punto. Nelle scene sintetiche utilizza l'Unscented Kalman Filter nello spazio mondo. Sulla clip broadcast reale viene eseguita sul piano immagine con un filtro Kalman bidimensionale (kf2d), poiché una singola clip non calibrata non fornisce profondità metrica e simulare un filtro 3D sarebbe disonesto. I gate vengono riutilizzati invariati; cambia onestamente soltanto il filtro. È questo a rendere il layer agnostico rispetto al rilevatore: il valore risiede nei gate, non nel rilevatore.
Gli screenshot sottostanti provengono dall'effettiva dashboard operativa di Plumbline. L'impostore della testa calva è una riproduzione introdotta dagli autori dell'incidente documentato del 2020, indicata esplicitamente nell'applicazione.
Nell'arco della scena di 44 fotogrammi, il rilevatore simulato emette 18 falsi rilevamenti di "palla" ad alta confidenza sulla testa del guardalinee, con confidenza fino al 98%. I tre gate li rifiutano tutti e 18. Il peggior singolo impostore registra 82.3σ sul gate cinematico, ben oltre la soglia di rifiuto di 5σ, mentre la palla reale, con circa l'87% di confidenza e 0.4σ, supera tutti e tre i gate e rimane agganciata. In questo singolo scenario, il layer di fisica ha mantenuto il 97.7% di tempo sul bersaglio con 1 cambio di ID, contro il 59.1% della strategia di inseguimento della massima confidenza e il 20.5% della soglia incrementata (l'aggregato sintetico dei tre scenari è riportato nella tabella comparativa più in basso).
Quando un giocatore incrocia brevemente la palla, il tracker ingenuo la perde oppure aggancia il giocatore. Il tracker fisico entra in COAST e segue la previsione durante l'interruzione, riagganciando poi la palla quando riappare. Non inventa mai un rilevamento per colmare l'assenza di dati; prevede, contrassegna lo stato e attende.
Su una clip broadcast reale di 240 fotogrammi, i rilevamenti YOLO11x reali alimentano gli stessi tre gate operanti nello spazio immagine. I gate hanno mantenuto la palla per il 68.3% dei fotogrammi contro il 43.8% del tracker ingenuo e il 30.0% del tracker con soglia incrementata, con 4 cambi di ID rispetto a 7 e un errore medio di 26.2 px contro 193.0 px. È comprensibilmente inferiore al limite teorico sintetico perché i filmati reali sono più complessi. L'evidenza che la fisica superi entrambe le baseline si conferma sui rilevamenti reali, non soltanto su quelli simulati.
Il log decisionale esportato svela l'intera traccia: seed, scenario, ID del rilevatore e soglie in alto, seguiti da una registrazione fotogramma per fotogramma di classe e confidenza di ciascun candidato, verdetto numerico di ogni gate con la relativa motivazione descrittiva, azione finale e traccia vincolata, concludendo con il tabellone dei risultati. Per un team esposto a responsabilità legali su decisioni visive automatizzate, questa costituisce una traccia archiviabile del motivo per cui ogni singolo rilevamento è stato ritenuto attendibile o respinto.
Queste metriche misurano la qualità del tracciamento, indipendentemente dalla qualità del rilevatore. Non rappresentano mai un tasso di errore del modello né una garanzia in contesti open-world. I due insiemi seguenti appartengono ad ambiti differenti e non vengono combinati.
| Tracker | Tempo sul bersaglio | Cambi di ID | Err medio (px) | Mancati agganci su set pulito |
|---|---|---|---|---|
| Veriprajna fisica | 97.7% | 3 | 2.7 | 2.3% |
| B1: segui la massima confidenza | 80.3% | 4 | 63.0 | 0.0% |
| B2: soglia di confidenza incrementata | 40.2% | 29 | 115.0 | 43.2% |
| Tracker | Tempo sul bersaglio | Cambi di ID | Err medio (px) |
|---|---|---|---|
| Veriprajna fisica | 68.3% | 4 | 26.2 |
| B1: segui la massima confidenza | 43.8% | 7 | 193.0 |
| B2: soglia di confidenza incrementata | 30.0% | 1 | 245.1 |
Il dato che convalida la tesi è il risultato di ortogonalità. Sul set sintetico pulito, aumentare la soglia di confidenza (B2) perde il 43.2% delle palle autentiche a bassa confidenza, mentre la fisica contiene le omissioni su set pulito al 2.3%, il che rappresenta una latenza di acquisizione di un singolo fotogramma e non un falso negativo. Agire sulla manopola della confidenza baratta un tipo di errore con un altro. La fisica opera in modo ortogonale rispetto a essa. (Il singolo cambio di ID di B2 sui filmati reali è un artefatto dovuto al fatto che traccia a malapena qualcosa con il 30% di tempo sul bersaglio, non una vittoria).
No. Plumbline opera a valle di qualsiasi rilevatore già in uso e stabilisce a quali dei suoi rilevamenti candidati accordare fiducia. Nella demo, lo stesso codice dei gate viene eseguito su un rilevatore black-box simulato per le scene sintetiche e su rilevamenti YOLO11x reali per la clip broadcast. Non alteriamo la qualità dell'output del rilevatore. Il prodotto è il layer deterministico di gate che lo circonda, garantendo che il valore rimanga intatto anche con l'evoluzione del rilevatore sottostante.
Perché è la leva sbagliata su cui agire. Sul set sintetico pulito, aumentare la soglia di confidenza scarta il 43.2% delle palle autentiche a bassa confidenza, continuando tuttavia ad agganciare l'impostore ad alta confidenza. I gate fisici operano in modo ortogonale rispetto alla confidenza: hanno contenuto i falsi negativi sul set pulito al 2.3%, che corrisponde a una latenza di acquisizione di un singolo fotogramma anziché a una palla persa. Non è possibile separare una palla reale da un impostore basandosi unicamente sul punteggio quando l'impostore ottiene un punteggio superiore.
Entrambi, e manteniamo i due ambiti nettamente distinti. In un'esecuzione sintetica controllata con ground truth nota (seed 7), il layer di fisica ha mantenuto il 97.7% di tempo sul bersaglio rispetto all'80.3% della strategia basata sulla massima confidenza e al 40.2% della soglia incrementata. Su una clip broadcast reale da 240 fotogrammi con rilevamenti YOLO11x effettivi, gli stessi gate hanno mantenuto la palla per il 68.3% dei fotogrammi contro il 43.8% e il 30.0%. Il dato sui filmati reali è comprensibilmente inferiore perché il video reale è più complesso. Non presentiamo mai il dato sintetico come un risultato reale.
I tre gate sono semplice codice numpy e scipy, del tutto esterno a qualsiasi modello: un gate cinematico Kalman/UKF (accetta sotto 3 sigma, rifiuta sopra 5 sigma), un gate di coerenza del flusso ottico e un gate di prospettiva geometrica. La fiducia non dipende dall'autovalutazione di un modello. È presente un narratore di audit opzionale che converte la telemetria dei gate in un riepilogo in linguaggio naturale, ma ha solo funzione consultiva, non interviene mai nel percorso di accettazione o rifiuto e passa a un riepilogo deterministico basato su modelli predefiniti quando non è presente alcuna chiave.
Sì. Ogni decisione include una motivazione fisica registrata a sistema. Il log decisionale esportato riporta nell'intestazione seed, scenario, ID del rilevatore e soglie dei gate, per poi elencare per ogni fotogramma ciascun candidato con classe e confidenza, il verdetto numerico di ciascun gate e la spiegazione in linguaggio naturale (ad esempio: Mahalanobis 82 sigma oltre la soglia di 5 sigma, cinematicamente impossibile), l'azione finale e la traccia vincolata. Può essere esportato in formato JSON o HTML.
No su entrambi i fronti. Si tratta di una demo eseguibile che convalida il meccanismo dei gate, non di una pipeline distribuita in produzione. I benchmark di riferimento che superiamo appartengono alla categoria delle modalità di guasto ingenue rispetto alla fisica (inseguimento della massima confidenza e innalzamento della soglia), non a uno specifico fornitore. Non pretendiamo di tracciare meglio di un prodotto commerciale, e i principali fornitori di telecamere hanno già corretto lo specifico caso del guardalinee calvo del 2020 nei firmware successivi. L'impostore della testa calva nella demo è una riproduzione inserita dagli autori di quell'incidente documentato, non rumore organico del rilevatore catturato dal vivo.
La ricerca alla base di questa demo: l'architettura, la progettazione della verifica e il blueprint aziendale.
Soluzione completa
Esplora la soluzione di Computer Vision vincolata alla fisica →Se una decisione visiva automatizzata comporta responsabilità legali nel vostro settore, la modalità di guasto riguarda la fisica, non la confidenza.
Abbiamo creato Plumbline per dimostrare che un layer di gate deterministici può respingere un rilevamento fisicamente impossibile fornendo una motivazione documentabile e archiviabile. Lo stesso framework supporta principi fisici differenti: un gate di parallasse per una fonderia di semiconduttori, un gate di riflettanza per una linea di produzione. Indicateci il vincolo che il vostro rilevatore continua a violare e valuteremo insieme se un layer di gate sia la soluzione idonea.