Physikbeschränkte Computer Vision

Physik überstimmt Pixel.

Unter Flutlicht kann ein glänzender Kahlkopf als „Ball“ mit 98 % Konfidenz gewertet werden, sodass eine Kamera, die der höchsten Konfidenz folgt, vom Spielfeld wegschwenkt. Plumbline ist eine deterministische Physik-Gate-Schicht, die hinter Ihrem Detektor geschaltet ist, jene Detektionen verwirft, die die Physik verbietet, und dabei fest auf dem realen Ball arretiert bleibt.

Es ist die Verifikationsschicht zwischen Ihrem Detektor und Ihrem ausführenden System. Führen Sie die Demo aus und lesen Sie die physikalische Begründung, die für jede Entscheidung protokolliert wurde.

Kommentierter Rundgang durch das laufende Plumbline-Dashboard (3:58).

97.7%

Zielverfolgungszeit, Physik-Gate

Synthetischer Benchmark, Seed 7

82.3σ

Schlechtester Impostor, jenseits der 5σ-Linie verworfen

bald_linesman-Audit, 44 Frames

68.3%

Zielverfolgungszeit, realer Übertragungsclip

Echtes YOLO11x, 240 Frames, Bildraum

Die beiden Benchmark-Bereiche werden auf dieser gesamten Seite strikt getrennt gehalten. Der synthetische Wert ist ein kontrolliertes Maximum gegenüber einer bekannten Ground Truth; der Wert des realen Videomaterials fällt bei anspruchsvollen echten Videoaufnahmen ehrlicherweise niedriger aus.

Ein Detektor hat kein Gedächtnis dafür, wo sich ein reales Objekt als Nächstes befinden kann

Das Versagen ist ein physikalisches Versagen, kein Detektionsversagen.

Ein Objektdetektor arbeitet Frame-unabhängig. Er bewertet jedes Bild anhand von Textur und Form, ohne jede Vorstellung davon, wo sich ein reales Objekt im nächsten Frame physikalisch befinden kann. Unter Stadionflutlicht glänzt ein Kahlkopf wie ein Ball; der Detektor meldet daher einen „Ball“ mit 98 % Konfidenz auf dem Kopf, während der eigentliche Ball schlechter bewertet wird – und eine Kamera, die der höchsten Konfidenz folgt, verfolgt den Kopf statt des Spielgeschehens.

Dies ist dokumentiert, nicht hypothetisch. Im Oktober 2020 verfolgte eine automatisierte Pixellot-Kamera bei Inverness Caledonian Thistle ein ganzes Spiel lang den kahlen Kopf eines Linienrichters anstelle des Balls (Veriprajna WP43-Lösungsseite, 2026). Es handelt sich auch nicht um ein einmaliges Versagen, das bessere Modelle von selbst erübrigen: Der eigene Tracking-Benchmark von SoccerNet kommt zu dem Schluss, dass die Mehrfachobjektverfolgung im Fußball „noch lange nicht gelöst“ sei, wobei bislang kein physikbewusstes Tracking in Benchmark-Methoden integriert ist – eine deutliche Lücke (Veriprajna WP43-Forschung, 2026).

Der Grund, warum sich dieses Problem mit besseren Detektoren nicht von selbst erledigt, liegt darin, dass eine physikalisch unmögliche Detektion bei jeder Detektorgenauigkeit falsch bleibt. Ein „Ball“, der auf einer konstanten Höhe von 1,7 m verharrt und sich mit 3 mph bewegt, ist kein Ball – ganz gleich, wie sicher sich das Modell ist. Für ein Team, das die Haftung für eine automatisierte visuelle Entscheidung trägt, liegen die Kosten in den Grenzfällen: Ein Branchenbericht beziffert sie auf „80 % der Entwicklungszeit, 90 % der Supportkosten, 100 % des Haftungsrisikos“ (Veriprajna WP43-Forschung, 2026).

Drei deterministische Gates, die das Modell nicht überstimmen kann

Plumbline läuft dem Detektor nachgelagert. Es prüft für jede Kandidatendetektion, ob die Physik sie zulässt, leitet den Frame anschließend an Accept, Review oder Coast weiter und protokolliert die Begründung.

Gate 1: Kinematik

Ein Kalman/UKF-Filter (Projektil-Prozessmodell plus ein nichtlineares Pinhole-Messmodell) prognostiziert, wo sich ein realer Ball befinden kann. Die Innovation jedes Kandidaten wird zu einer Mahalanobis -Distanz. Schwellenwerte werden als Konfiguration ausgeliefert: Akzeptieren unter 3σ, Verwerfen über 5σ, Markieren von 3 bis 5σ als REVIEW. Im schlechtesten Frame der Kahlkopf-Linienrichter-Szene erzielte der Impostor 82.3σ.

Gate 2: Optischer Fluss

Das Gate vergleicht die vom Track prognostizierte Pixelgeschwindigkeit mit dem lokalen optischen Fluss des Kandidaten und verwirft bei Richtungs- oder Betragsabweichungen (ausgeliefertes Band: Flussverhältnis in [0.35, 3.0], Kosinus mindestens 0,3). Ein „Ball“, der mitten im Spiel nahezu stillsteht, fällt hier durch.

Gate 3: Geometrie

Das Pinhole-Modell liefert die Pixelgröße, die ein 22-cm-Ball bei der implizierten Tiefe des Kandidaten einnehmen kann, und das Gate verwirft unmögliche Größen (Größenverhältnis-Toleranz 1,8x auf dem synthetischen Pfad, 1,5x auf dem Bildraumpfad für reales Videomaterial). Ein rund 50 px großer Kopf kann kein 22-cm-Ball in etwa 12 m Entfernung sein, der rund 22 px einnehmen würde.

Ein deterministisches Richtlinien-Gate entscheidet anschließend unter Verwendung derselben gates.py – unverändert auf beiden Eingabepfaden. Es akzeptiert nur, wenn alle Gates bestanden sind. Es markiert einen grenzwertigen Kandidaten (3 bis 5σ ohne harten Fehler) als REVIEW, und der Track führt die Vorhersage weiter (Coast), eskaliert statt geblufft. Es wechselt auf COAST (reine Vorhersage), wenn jeder Kandidat verworfen wird – etwa bei einer kurzen Verdeckung –, und erfasst den Ball erneut, sobald er wieder auftaucht. Die Schwellenwerte sind Konfigurationsparameter und werden von keinem Modell vorgegeben.

Jede Entscheidung wird in einem Audit-Datensatz protokolliert. Der Header enthält Seed, Szenario, Detektor-ID und Gate-Schwellenwerte. Jeder Frame listet jeden Kandidaten mit seiner Klasse und Konfidenz, das numerische Urteil jedes Gates samt verständlicher Begründung, die finale Aktion sowie den fixierten Track auf. Ein optionaler Audit-Narrator wandelt diese Telemetriedaten in eine verständliche Vorfallzusammenfassung für den Export um; er hat jedoch rein beratenden Charakter, liegt niemals im Annahme- oder Verwerfungspfad und schaltet auf eine deterministische, vorlagenbasierte Zusammenfassung zurück, wenn kein Modellschlüssel oder keine Bridge vorhanden ist, sodass die Demo vollständig offline ausgeführt werden kann.

Dieselbe Drei-Gate-Richtlinie läuft auf zwei Arten von Eingabedaten – und genau darum geht es. In den synthetischen Szenen nutzt sie das Unscented Kalman Filter im Weltraum. Auf dem realen Übertragungsclip läuft sie in der Bildebene mit einem 2D-Kalman-Filter (kf2d), da ein einzelner, unkalibrierter Clip keine metrische Tiefe liefert und das Vortäuschen eines 3D-Filters unehrlich wäre. Die Gates werden unverändert wiederverwendet; nur das Filter wird ehrlich angepasst. Das macht die Schicht detektoragnostisch: Der Mehrwert liegt in den Gates, nicht im Detektor.

Was die Gates tun – Frame für Frame

Die folgenden Screenshots stammen aus dem tatsächlich laufenden Plumbline-Dashboard. Der kahlköpfige Impostor ist eine vom Autor eingefügte Reproduktion des dokumentierten Vorfalls von 2020, was in der Anwendung unmissverständlich angegeben ist.

Plumbline-Geteilter-Bildschirm: Links liegt die Box des naiven Trackers auf dem Kahlkopf des Linienrichters, rechts bleibt der physikgestützte Tracker auf dem realen Ball, während der Live-Gate-Feed zeigt, wie der Kopf-Kandidat bei 82,3 Sigma verworfen wird.

Die Abweisung des Kahlkopf-Linienrichters (synthetisch)

Über die 44-Frame-Szene hinweg liefert der simulierte Detektor 18 Fehlmeldungen für „Ball“ mit hoher Konfidenz auf dem Kopf des Linienrichters – bis zu 98 % Konfidenz. Die drei Gates verwerfen alle 18. Der gravierendste einzelne Impostor erzielt 82.3σ am kinematischen Gate, weit jenseits der 5σ-Verwerfungsgrenze, während der reale Ball bei rund 87 % Konfidenz und 0.4σ alle drei Gates passiert und arretiert bleibt. In diesem Einzelszenario erreichte die Physik-Schicht 97,7 % Zielverfolgungszeit bei 1 ID-Wechsel, gegenüber 59,1 % bei Verfolgung der höchsten Konfidenz und 20,5 % bei angehobener Schwelle (das synthetische Aggregat über drei Szenarien findet sich in der Vergleichstabelle weiter unten).

Plumbline im Verdeckungsszenario: Ein Spieler kreuzt vor dem Ball, der naive Tracker springt auf den Spieler über, und der Physik-Tracker hält eine vorhergesagte Position mit der Markierung COAST, bis der Ball wieder auftaucht.

Überbrückung von Verdeckungen (synthetisch)

Wenn ein Spieler den Ball kurzzeitig kreuzt, verliert der naive Tracker ihn oder springt auf den Spieler an. Der Physik-Tracker schaltet auf COAST, überbrückt die Lücke anhand der Vorhersage und erfasst den Ball erneut, sobald er wieder sichtbar wird. Er erfindet niemals eine Detektion, um die Leerstelle zu füllen; er prognostiziert, markiert den Zustand und wartet.

Plumbline im Einsatz auf einem realen Übertragungsclip mit echten YOLO11x-Detektionen im Bildraum; die Anzeigetafel weist 68,3 % physikalische Zielverfolgungszeit gegenüber 43,8 % und 30,0 % für die beiden Baselines aus.

Dieselben Gates auf realem Videomaterial

In einem realen 240-Frame-Übertragungsclip speisen echte YOLO11x-Detektionen dieselben drei im Bildraum laufenden Gates. Die Gates hielten den Ball in 68,3 % der Frames, verglichen mit 43,8 % beim naiven Tracker und 30,0 % beim Tracker mit angehobener Schwelle, bei 4 ID-Wechseln gegenüber 7 und einem mittleren Fehler von 26,2 px gegenüber 193,0 px. Dieser Wert liegt ehrlicherweise unter dem synthetischen Maximalwert, da reales Videomaterial anspruchsvoller ist. Der Grundsatz – die Physik schlägt beide Baselines – bestätigt sich bei realen Detektionen ebenso wie bei simulierten.

Das exportierte Plumbline-Entscheidungsprotokoll im Browser: Es zeigt den Header mit Seed und Gate-Schwellenwerten sowie zeilenweise pro Frame jeden Kandidaten, die Gate-Urteile und die verständliche physikalische Begründung für jede Entscheidung.

Eine physikalische Begründung für jede protokollierte Entscheidung

Das exportierte Entscheidungsprotokoll legt den gesamten Verlauf offen: Seed, Szenario, Detektor-ID und Schwellenwerte im Kopfbereich, gefolgt von einer Frame-genauen Aufzeichnung über Klasse und Konfidenz jedes Kandidaten, das numerische Urteil jedes Gates samt verständlicher Begründung, die finale Aktion und den arretierten Track – abgeschlossen durch die Anzeigetafel. Für ein Team, das die Haftung für eine automatisierte visuelle Entscheidung trägt, ist dies ein revisionssicherer Nachweis darüber, warum jede Detektion akzeptiert oder abgelehnt wurde.

Der gemessene Vergleich mit genauem Geltungsbereich

Dies sind Metriken zur Tracking-Qualität, unabhängig von der Detektorqualität. Sie stellen zu keinem Zeitpunkt eine Modellfehlerrate dar und bieten keine Open-World-Garantie. Die beiden nachfolgenden Datensätze beziehen sich auf unterschiedliche Geltungsbereiche und werden nicht miteinander vermengt.

Synthetisches Aggregat (Seed 7, über bald_linesman, occlusion und clean)

Tracker Zielverfolgungszeit ID-Wechsel Mittl. Fehler (px) Verlustrate (Clean-Set)
Veriprajna-Physik 97.7% 3 2.7 2.3%
B1: Höchster Konfidenz folgen 80.3% 4 63.0 0.0%
B2: Angehobene Konfidenzschwelle 40.2% 29 115.0 43.2%

Reales Übertragungsmaterial (echtes YOLO11x, 240 Frames, Bildraum-Gates)

Tracker Zielverfolgungszeit ID-Wechsel Mittl. Fehler (px)
Veriprajna-Physik 68.3% 4 26.2
B1: Höchster Konfidenz folgen 43.8% 7 193.0
B2: Angehobene Konfidenzschwelle 30.0% 1 245.1

Die Zahl, die diese These untermauert, ist das Orthogonalitätsergebnis. Auf dem synthetischen Clean-Set verwirft das Anheben der Konfidenzschwelle (B2) 43,2 % der echten Bälle mit niedriger Konfidenz, während die Physik ihre Clean-Set-Verlustrate bei 2,3 % hält – was einer Erfassungslatenz von nur einem Frame entspricht und keinem Falsch-Negativ. Das Drehen am Konfidenzregler tauscht lediglich einen Fehler gegen einen anderen ein. Die Physik arbeitet orthogonal dazu. (Dass B2 auf dem realen Videomaterial nur einen einzigen ID-Wechsel verzeichnet, ist ein Artefakt der Tatsache, dass bei 30 % Zielverfolgung kaum noch etwas getrackt wurde, und kein Erfolg.)

Was diese Demo nicht leistet

  • Es handelt sich um eine lauffähige Demo, die den Gate-Mechanismus demonstriert, nicht um eine produktiv bereitgestellte Pipeline.
  • Der Kahlkopf-Impostor ist eine vom Autor eingefügte Reproduktion des Vorfalls von 2020, kein organisches Detektorrauschen aus einer Live-Aufnahme.
  • Der Pfad für reales Bildmaterial arbeitet ehrlicherweise im Bildraum (mit einem 2D-Kalman-Filter) und nicht als kalibriertes 3D-Weltraum-Filter, da ein einzelner, unkalibrierter Clip keine metrische Tiefe besitzt.
  • Die Baselines repräsentieren die Klasse physiknaiver Fehlermodi (B1 und B2), keinen namentlich genannten Anbieter. Wir erheben keinen Anspruch darauf, Pixellot, Veo, Spiideo oder irgendein am Markt erhältliches Produkt beim Tracking zu übertreffen, und eine spätere Firmware von Pixellot hat den konkreten Fall des Kahlkopfs bereits behoben.
  • YOLO11x wird auf dem realen Clip offline als austauschbarer Detektor eingesetzt. Wir entwickeln oder verbessern den Detektor nicht.
  • Das Parallaxen-Gate für die Halbleiterfertigung und das Reflektanz-Gate für Fertigungslinien sind als modulare Schnittstellenerweiterung konzipiert, die hier zurückgestellt und nicht vorgeführt wird.
  • Es werden keinerlei Kunden, Einsätze, Ligen oder Rundfunkanstalten impliziert. Der Vorfall von Inverness 2020 und SoccerNet sind zitierte öffentliche Referenzen, nicht unsere Kunden.
  • Der Audit-Narrator dient der Beratung. Er erläutert Entscheidungen; er trifft sie niemals.

Fragen von Engineering- und Produkt-Teams

Ist das nicht einfach ein besserer Detektor oder ein Wrapper um YOLO?

Nein. Plumbline sitzt dem Detektor nachgelagert, den Sie bereits einsetzen, und entscheidet, welchen der vorgeschlagenen Kandidatendetektionen vertraut werden kann. In der Demo läuft derselbe Gate-Code auf einem simulierten Blackbox-Detektor für die synthetischen Szenen und auf echten YOLO11x-Detektionen für den Übertragungsclip. Wir greifen nicht in die Ausgabequalität des Detektors ein. Das Produkt ist die deterministische Gate-Schicht darum herum – daher bleibt der Mehrwert auch dann bestehen, wenn sich der zugrunde liegende Detektor verbessert.

Warum hebt man nicht einfach die Konfidenzschwelle an, um den falschen Ball zu verwerfen?

Weil das der falsche Hebel ist. Auf dem synthetischen Clean-Set führt ein Anheben der Konfidenzschwelle dazu, dass 43,2 % der echten Bälle mit geringer Konfidenz verworfen werden, während der Impostor mit hoher Konfidenz weiterhin fälschlich erfasst wird. Die Physik-Gates arbeiten orthogonal zur Konfidenz: Sie begrenzten ihre Verlustrate auf dem Clean-Set auf 2,3 %, was eher einer Erfassungslatenz von einem Frame als einem verlorenen Ball entspricht. Man kann einen echten Ball nicht allein anhand des Scores von einem Impostor trennen, wenn der Impostor eine höhere Bewertung erzielt.

Funktioniert das tatsächlich auf realem Videomaterial oder nur in einer Simulation?

Beides, und wir halten beides streng getrennt. In einem kontrollierten synthetischen Durchlauf mit bekannter Ground Truth (Seed 7) erzielte die Physik-Schicht 97,7 % Zielverfolgungszeit gegenüber 80,3 % bei Verfolgung der höchsten Konfidenz und 40,2 % bei angehobener Schwelle. Auf einem realen Übertragungsclip von 240 Frames mit echten YOLO11x-Detektionen hielten dieselben Gates den Ball in 68,3 % der Frames, verglichen mit 43,8 % und 30,0 %. Die Kennzahl für reales Bildmaterial ist ehrlicherweise niedriger, da reales Videomaterial anspruchsvoller ist. Wir geben den synthetischen Wert niemals als reales Ergebnis aus.

Woher weiß ich, dass die Gates entschieden haben und nicht ein Sprachmodell?

Die drei Gates bestehen aus reinem numpy- und scipy-Code außerhalb jeglichen Modells: ein kinematisches Kalman/UKF-Gate (Akzeptanz unter 3 Sigma, Verwerfung über 5 Sigma), ein Konsistenz-Gate für den optischen Fluss und ein geometrisches Perspektiv-Gate. Vertrauen basiert hierbei nicht auf der Selbstaussage eines Modells. Es gibt einen optionalen Audit-Narrator, der die Gate-Telemetrie in eine verständliche Zusammenfassung übersetzt; dieser ist jedoch rein informativ, befindet sich zu keinem Zeitpunkt im Annahme- oder Verwerfungspfad und weicht auf eine deterministische Vorlagenzusammenfassung aus, wenn kein API-Schlüssel hinterlegt ist.

Kann ich nachvollziehen, warum eine bestimmte Detektion akzeptiert oder verworfen wurde?

Ja. Jede Entscheidung hinterlegt eine physikalische Begründung im Protokoll. Das exportierte Entscheidungsprotokoll erfasst im Header den Seed, das Szenario, die Detektor-ID und die Gate-Schwellenwerte; anschließend führt es für jeden Frame jeden Kandidaten mit Klasse und Konfidenz, das numerische Urteil jedes Gates samt verständlicher Begründung (beispielsweise: Mahalanobis 82 Sigma über der 5-Sigma-Grenze, kinematisch unmöglich), die finale Aktion und den arretierten Track auf. Der Export erfolgt als JSON oder HTML.

Ist dies einsatzbereit und übertrifft es Pixellot oder Veo?

Nein zu beidem. Dies ist eine lauffähige Demo, die den Gate-Mechanismus demonstriert, keine produktiv eingesetzte Pipeline. Die Baselines, die wir übertreffen, gehören zur Klasse physiknaiver Fehlermodi (höchster Konfidenz folgen bzw. Schwelle anheben), nicht zu einem namentlich genannten Anbieter. Wir erheben keinen Anspruch darauf, ein marktreifes Produkt beim Tracking zu übertreffen, und die bekannten Kamerahersteller haben den konkreten Fall des Kahlkopf-Linienrichters von 2020 in späteren Firmware-Versionen bereits behoben. Der Kahlkopf-Impostor in der Demo ist eine vom Autor eingefügte Reproduktion dieses dokumentierten Vorfalls, kein organisch live erfasstes Detektorrauschen.

Technische Forschung

Die Forschung hinter dieser Demo – die Architektur, das Verifikationsdesign und die Enterprise-Blueprint.

Social

Auch veröffentlicht auf

Schalten Sie ein Physik-Gate zwischen Ihren Detektor und Ihr ausführendes System

Wenn eine automatisierte visuelle Entscheidung in Ihrer Praxis haftungsrelevant ist, liegt das Versagensmuster in der Physik, nicht in der Konfidenz.

Wir haben Plumbline entwickelt, um zu zeigen, dass eine deterministische Gate-Schicht eine physikalisch unmögliche Detektion verwerfen und eine revisionssichere Begründung dafür hinterlegen kann. Dasselbe Framework lässt sich auf andere physikalische Bedingungen anwenden: ein Parallaxen-Gate für eine Halbleiter-Fab oder ein Reflektanz-Gate für eine Fertigungslinie. Schildern Sie uns die Randbedingung, die Ihr Detektor immer wieder verletzt, und wir prüfen gemeinsam, ob eine Gate-Schicht dafür geeignet ist.

Analyse der Fehlermodi im Vision-System

  • ✓ Abweichungen zwischen Detektorkonfidenz und physikalischer Plausibilität kartieren
  • ✓ Physikalisch unmögliche Detektionen identifizieren, auf deren Basis heute Aktionen ausgelöst werden
  • ✓ Relevante kinematische, flussbasierte und geometrische Randbedingungen definieren
  • ✓ Den Audit-Trail für haftungsrelevante Entscheidungen verbindlich abstecken

Implementierung der Physik-Gate-Schicht

  • ✓ Deterministische Gates als einsehbare Codebasis außerhalb jeglicher Modelle
  • ✓ Detektoragnostisch: Behalten Sie Ihren bestehenden Detektor unverändert bei
  • ✓ Audit-Protokoll pro Entscheidung mit dokumentierter physikalischer Begründung
  • ✓ Metriken zur Tracking-Qualität, die auch bei Weiterentwicklung des Detektors Bestand haben