Archivplattform
‹ Features in Action

Vom Dokument im Archiv bis zur digitalen Lesefassung: eine KI-gestützte Pipeline mit Leitplanken

Features in Action 23. August 2026

Über hundert Jahrgänge einer Vereinszeitschrift sind ein großer Schatz, bergen aber auch Probleme. Der Schatz: Berichte, Personalnachrichten, Nachrufe, Fotos; das kollektive Gedächtnis des Vereins in gedruckter Form. Das Problem: All das steckt in gebundenen Bänden und losen Heften, mit unterschiedlichen Layouts, teilweise in Fraktur gesetzt, zum Großteil im Archiv verstaut und ist damit praktisch nicht nutzbar. Wer wissen will, was 1927 geschrieben wurde, muss blättern. Ziel der Digitalisierung war deshalb nicht das übliche „PDF mit Texterkennung", wo man sich mit minderwertigen OCR-Technologien zufrieden gibt, sondern eine echte digitale Lesefassung. Jeder Artikel wird einzeln, mit Überschrift, Autor, Bildern, Tags, einer Zusammenfassung in einer modernen Ansicht von überall aus lesbar. Und das Herzstück begeistert besonders: automatische Verknüpfungen der erwähnten Personen.

Die unterschätzte Vorstufe: Ordnung im Scan-Stapel

Historische Hefte liegen oft nicht als saubere Einzelseiten vor, sondern als Druckbögen: große Bögen, auf denen mehrere Seiten angeordnet sind. Wenn man sie als Bögen einscannt, hat man die Seitenreihenfolge 1,32,2,31,3,3,30,... Bevor man also die Überführung in Text angeht, muss die Pipeline die physische Wirklichkeit rekonstruieren: welche Scanseite ist welche logische Heftseite? Das wurde Skriptbasiert automatisiert sodass die Arbeitsstunden der Freiwilligen für sinnvollere Arbeiten eingesetzt werden.

Vom Seitenbild zum Artikel

Danach arbeitet die Pipeline in Stufen weiter: Zuerst wird das Layout jeder Seite erfasst, also die etwaige mehrspaltigkeit, Überschriften, Bilder zur Illustration, Bildunterschriften und Angaben zur Autorenschaft. Dann wird die Lesereihenfolge bestimmt, denn zweispaltiger Satz mit eingestreuten Bildern ist für Maschinen alles andere als selbstverständlich. Erst darauf aufbauend werden die Artikelgrenzen gezogen: Wo endet der Bericht über das Sommerfest, wo beginnt der Nachruf? Zwischenüberschriften werden als solche erkannt und nicht als neue Artikel missverstanden, Bilder werden dem richtigen Artikel zugeschlagen und behalten ihre Unterschriften, Formatierungen wie Fettgedrucktes und Tabellen werden korrekt extrahiert und überführt.

Leitplanken statt Blindflug

Der entscheidende Unterschied zu einem naiven „KI, mach mal"-Ansatz sind die Leitplanken. Jede Stufe der Pipeline produziert nicht nur ein Ergebnis, sondern auch Prüfsignale, an denen sich das Ergebnis messen lassen muss:

Die Frage ist nie „Kann die KI das?", sondern „Woran merke ich, wenn sie sich irrt?"

Dieses Prinzip macht den Unterschied zwischen einem Demo-Projekt und einem Archiv, dem man vertrauen kann. Geschwindigkeit ist willkommen, eine robuste und nachvollziehbare Qualität aber wichtiger.

In der Praxis heißt das auch: gestaffelt arbeiten. Neue Jahrgänge laufen zunächst in kleinen Tranchen durch die Pipeline; erst wenn die Stichproben eines Durchlaufs sauber sind, wird die nächste Tranche verarbeitet. Ein Fehler in der Konfiguration verdirbt so schlimmstenfalls ein Heft und nicht einen ganzen Jahrgang. Und da bei jedem Verarbeitungsschritt ordentlich und lesbar geloggt wird, lässt sich jederzeit nachvollziehen, aus welchem Scan, welcher Seite und welchem Lauf ein Artikel stammt.

Der eigentliche Gewinn: Verknüpfung

Sobald ein Artikel als Text vorliegt, beginnt die Kür: Erwähnte Personen und Autoren werden mit dem Personenverzeichnis der Plattform verknüpft. Aus „stud. jur. Müller" im Bericht von 1927 wird ein Klick zum Personenprofil — und umgekehrt listet jedes Profil auf, wo genau die Person in den verschiedenen Veröffentlichungen über die 170 Jahre hinweg erwähnt wurde. Aus der in geringer Stückzahl vorhandenen und im Archiv gesicherten Quelle wird ein von überall erreichbares und durchsuchbares Geflechts aus Personen, Ereignissen und Quellen.

Übertragbar auf andere Bestände

Nichts an diesem Vorgehen ist auf eine bestimmte Zeitschrift beschränkt. Gleich aufgebaute Probleme — Chroniken, Protokollbücher, Mitgliederverzeichnisse, Gästebücher und vieles mehr lassen sich mit derselben Architektur erschließen: erst die physische Ordnung rekonstruieren, dann strukturiert lesen, an jeder Stufe verifizieren, am Ende verknüpfen. Die konkreten Werkzeuge und Modelle, die dabei im Einsatz sind, wechsle ich je nach Material und auf Basis des aktuellen Stands der Technik.

Falls Sie für ein ähnliches Projekt im Kopf haben und Unterstützung bei der Umsetzung wünschen, bin ich über das Kontaktformular gerne erreichbar.

Sie wollen mehr über die Umsetzung wissen?
Details zur Methode erkläre ich gern persönlich — Anfrage genügt.
Kontakt aufnehmen