Zum Inhalt springen

Forschung

Wir haben vier Jahre gebraucht.

Einen Fußball im Fernsehbild zuverlässig zu finden, klingt nach einer kleinen Aufgabe. Sie war es nicht: vier Jahre Arbeit an einem Objekt, das wenige Bildpunkte groß ist, sich schneller bewegt als die Belichtungszeit und ständig verdeckt wird.

Den Ball finden: 45 Sekunden aus der Auswertung

So sieht die Ballerkennung im Fernsehbild aus - auch in den Momenten, in denen der Ball klein, verdeckt oder vor der Bandenwerbung ist.

Videoplatz, etwa 0:45 Minuten: Bildschirmaufnahme der Auswertung: Spielszene mit eingeblendetem Rahmen um den Ball. Nur Material, an dem die Rechte bestehen. Sprecher aus dem Off.

Das Video als Text

(Im Bild: eine Szene aus einem Fußballspiel im Fernsehbild. Um den Ball liegt ein orangefarbener Rahmen, der ihm folgt.)

Das ist unser System bei der Arbeit. Es findet den Ball in jedem einzelnen Bild.

(Im Bild: der Ball fliegt vor der Bandenwerbung, dann verschwindet er hinter einem Spieler. Der Rahmen setzt aus und ist wieder da, sobald der Ball zu sehen ist.)

Schwierig sind genau diese Momente: Der Ball ist winzig, halb verdeckt oder vor einer Werbebande. Oder er ist weg - und das System muss wissen, dass er weg ist, statt einen Schuh zu melden.

(Im Bild: wieder die Szene, der Rahmen folgt dem Ball über einen langen Spielzug.)

Vier Jahre haben wir dafür gebraucht. Was das Verfahren leistet und wo es an Grenzen stößt, steht auf dieser Seite.

Warum die Aufgabe schwer ist

Der Ball ist klein, schnell und die Hälfte der Zeit nicht zu sehen. Und er ist nicht das einzige runde Objekt im Bild.

Ein Fernsehbild eines Fußballspiels ist für ein System eine unfreundliche Umgebung. Der Ball ist wenige Bildpunkte groß, er bewegt sich schneller als die Belichtungszeit und wird dadurch zu einem Strich statt zu einer Kugel. Die Kamera schwenkt, zoomt und wechselt den Standort. Das Licht ändert sich zwischen Sonne, Schatten und Flutlicht, oft innerhalb desselben Bildes. Spieler verdecken den Ball, das Tornetz zerlegt ihn in Fragmente, und auf der Tribüne sitzen zehntausend Menschen, von denen jeder etwas Rundes in der Hand halten kann.

Dazu kommt, dass es nicht reicht, den Ball in einem einzelnen Bild zu finden. Gebraucht wird die Spur über die Zeit: Wo war der Ball, wo ist er jetzt, und ist das überhaupt derselbe Ball. Ein System, das in jedem zweiten Bild einen Treffer meldet und dazwischen nichts, ist für eine Ereigniserfassung wertlos — auch dann, wenn seine Trefferquote je Einzelbild gut aussieht.

Was Precision und Recall bedeuten

Wer die Güte einer Erkennung angibt, muss zwei verschiedene Fragen beantworten. Ein System kann bei der einen glänzen, während es bei der anderen versagt.

Precision beantwortet: Wenn das System sagt „hier ist der Ball" — wie oft stimmt das? Ein vorsichtiges System, das nur in einfachen Szenen meldet, erreicht hier leicht hohe Werte.

Recall beantwortet: Von allen Bildern, in denen der Ball zu sehen ist — in wie vielen hat das System ihn gefunden? Ein System, das alles meldet, was rund ist, erreicht hier hohe Werte und bei Precision niedrige.

Erst beide Werte zusammen sagen etwas aus. Wer nur einen nennt, verschweigt den anderen.

Warum hier keine Prozentzahl steht

Eine Prozentzahl ohne Messmethode ist keine Aussage, sondern eine Behauptung. Zu einer belastbaren Angabe gehören die Trefferdefinition, die zeitliche und räumliche Toleranz, das ausgewertete Material samt Annotation und der Vergleichsmaßstab.

Diese Angaben sind vorhanden, aber noch nicht in einer Form, die wir veröffentlichen können — unter anderem, weil die Rechtelage am Videomaterial ungeklärt ist. Bis dahin steht hier keine Zahl. Wer die Messung für eine Zusammenarbeit prüfen möchte, bekommt sie im Gespräch.

Wo das System an Grenzen stößt

Das Verfahren wird unsicher, wenn der Ball über mehrere Bilder vollständig verdeckt ist, wenn er sich vor Werbebanden mit ähnlicher Farbe und Struktur bewegt, bei starkem Gegenlicht und Flutlicht mit hartem Schattenwurf, und bei Kameraeinstellungen, in denen er nur noch wenige Bildpunkte groß ist.

Dieser Abschnitt bleibt stehen, auch wenn er unbequem ist. Eine Forschungsangabe ohne benannte Grenzen wird nicht geglaubt, sondern eingeordnet — und zwar ungünstig.

Was daraus entstanden ist

Aus der Arbeit sind die Systeme entstanden, mit denen wir heute Ereignisse aus Bewegtbildern erfassen — aus dem Bild einer einzigen Kamera, ohne eigene Kameratechnik im Stadion. Sie sind die Grundlage für Videoanalyse und Auswertungen im Fußball, die vorher von Hand gemacht wurden.

Für Sie als Auftraggeber ist daran ein anderer Punkt wichtig: Wir haben vier Jahre an einer einzigen Frage gearbeitet, ohne dass zwischendurch ein Produkt daraus wurde. Das ist der Grund, warum wir auch dann noch da sind, wenn ein Projekt schwierig wird.

Kann ich dieses System kaufen?

Nein. Es ist kein Produkt, sondern der Nachweis, dass wir eine schwere Aufgabe über Jahre lösen können. Wenn Sie eine ähnliche Aufgabe haben — Ereignisse aus Bildern oder Videos erfassen, Zustände erkennen, Abläufe auswerten —, sprechen wir darüber, ob und wie sie sich lösen lässt.

Wo wurde trainiert und ausgewertet?

Auf eigener Hardware an einem deutschen Standort, nicht bei einem Anbieter außerhalb des EWR. Die Rechenausstattung ist bewusst überschaubar; sie umfasst rund 300 GB GPU-Speicher, 16 TB Speicher und eine 10-GbE-Anbindung.

Gibt es den Datensatz öffentlich?

[Offen. Die Rechtelage am Videomaterial ist zu klären, bevor ein Datensatz veröffentlicht werden kann.]

Diese Frage ist beantwortet. Die nächste ist schwerer.

An der Anschlussfrage arbeitet ein eigenes kleines Labor: Wie lernt ein System zusammenzuarbeiten, wenn es kein Belohnungssignal gibt? Offen, laufend, mit benannten Grenzen.

Maverick RDD

Sie haben eine Aufgabe in dieser Richtung?

Rufen Sie an. Ein Gespräch klärt in zehn Minuten, ob sich die Sache lohnt.

Stand: