Gesichtserkennung für historische Fotos
Gesichtserkennung selbst zu betreiben heißt, zwei Dinge in der Hand zu behalten: wie gründlich gesucht wird und wo die Bilder liegen. Der Anlass war hier ein Archiv voller historischer Fotografien, Gruppenbilder und Portraits über mehr als ein Jahrhundert. Auf vielen davon kannte niemand mehr die Gesichter. Und ein unbenanntes Foto ist für ein Archiv fast wertlos: Man kann es nicht zuordnen, nicht verknüpfen, nicht finden.
Wie das bisher lief: Detektivarbeit
Ein einziges Gruppenfoto zu erschließen, war ein Nachmittag Arbeit — und zwar echte Detektivarbeit. Zuerst die Kleidung datieren: Der Mode nach muss das Bild um 1905 bis 1914 entstanden sein, denn in der Nachkriegszeit wären Orden an der Brust zu sehen. Dann die Amtszeichen lesen: Bestimmte Ämter erkennt man an sichtbaren Attributen, und wer wann welches Amt hatte, steht in den Verzeichnissen — das grenzt weiter ein. Dazu markante Gesichter: ein verschmitztes Grinsen, ein besonders schmales Gesicht, oder jemand, den man einfach kennt, weil sein Gesicht aus späteren Bildern und Nachrufen im Gedächtnis geblieben ist.
Hat man den Zeitraum auf ein, zwei Jahre eingegrenzt, holt man die Einzelportraits aller Personen, die infrage kommen, und beginnt zu puzzeln: alle möglichen Köpfe neben das Gruppenbild legen, vergleichen, ausschließen. Am Ende weiß man manchmal, welche zwei Personen abgebildet sein müssen — aber nicht, welches Gesicht zu welchem Namen gehört. Auch das ist ein Ergebnis. Aber es hat einen Nachmittag gekostet. Pro Bild.
Was nun möglich ist
Heute läuft über den kompletten Bildbestand eine selbst betriebene Gesichtserkennung. Die Grundlage ist quelloffene Software — und genau das ist der Punkt: Man darf hineinschauen, verstehen, wie die Erkennung arbeitet, und sie für den eigenen Fall anpassen. Die Erkennungstiefe lässt sich selbst einstellen — wie gründlich gesucht wird, entscheide ich, nicht ein Hersteller. Und kein einziges Bild verlässt dabei das eigene System.
Bei einem typischen Gruppenfoto erkennt das System einen Teil der Gesichter sicher, macht bei weiteren Vorschläge, und bei einigen fehlen schlicht die Vergleichsdaten. Automatisch zusammengeführt wird bewusst nie — die Maschine schlägt vor, ein Mensch bestätigt. Ein falsch bestätigtes Gesicht würde alle folgenden Vorschläge vergiften; diese Regel ist deshalb nicht verhandelbar.
Der eigentliche Gewinn: die Frage dreht sich um
Das Überraschendste ist nicht die Zeitersparnis, sondern der Rückschluss. Die sicheren Treffer grenzen den Zeitraum eines Fotos von selbst ein — wenn fünf erkannte Personen nur in einem bestimmten Zeitfenster gemeinsam auftauchen konnten, ist das Bild datiert. Und dann dreht sich die Frage: Nicht mehr „Wer ist das?", sondern „Wer aus diesem Zeitraum fehlt mir noch?". Aus einer offenen Suche wird ein gezielter Abgleich.
Die Detektivarbeit ist damit nicht abgeschafft — sie ist dorthin verschoben, wo sie hingehört: zu den wirklich kniffligen Fällen, bei denen auch die Maschine passen muss. Genau dafür ist jetzt die Zeit da, die vorher das Routine-Vergleichen gefressen hat.
Was sich daraus mitnehmen lässt
Erstens: Quelloffene Werkzeuge sind mehr als Gratis-Software — sie sind die Erlaubnis, zu verstehen und anzupassen. Zweitens: Bei Erkennungsaufgaben gehört die letzte Entscheidung einem Menschen, sonst zerstört ein einziger Fehler das Vertrauen in alle folgenden Ergebnisse. Drittens: Der Wert von KI liegt oft nicht darin, eine Aufgabe zu erledigen, sondern darin, eine bessere Frage zu ermöglichen. Das gilt für Archivfotos genauso wie für jeden Datenbestand, in dem Menschen heute noch von Hand suchen.