Auszahlung – zur Quintessenz unseres Workshops zur Extraktion wirtschafts- und sozialhistorischer Tabelleninhalte
Ein Beitrag von Roman Kuhn und Christian Mathieu
Die quantitative kliometrische Wirtschafts- und Sozialgeschichtsforschung erlebt seit dem Ende der Periode relativer wirtschaftlicher Stabilität unter dem Einfluss der globalen Finanzkrise der Jahre 2007 bis 2009 international und gerade auch in Deutschland einen bemerkenswerten Aufschwung. Wesentlich getrieben wird diese durch die wachsende digitale Verfügbarkeit historischer Zeitreihen zusätzlich beschleunigte Entwicklung von der Erwartung, im historischen Vergleich ein besseres Verständnis der aktuellen Wirtschaftslage gewinnen zu können – so etwa im Rahmen des Akademieprojekts Finanz- und Unternehmensforschung aus der Langfristperspektive (1871–2020). Neben solchen Forschungsvorhaben mit integrierten Digitalisierungskomponenten wurden in den vergangenen zwanzig Jahren zudem zahlreiche genuine Infrastrukturprojekte zur systematischen virtuellen Zugänglichmachung unterschiedlichster tabellarisch strukturierter Quellengattungen durchgeführt.
Alleine im nationalen Kontext reicht deren Spektrum von preußischen Zensusdaten, den historischen Wochenberichten und Vierteljahrsheften des Deutschen Instituts für Wirtschaftsforschung über die Bände des Hoppenstedt-Aktienführers bzw. der amtlichen Statistik des Deutschen Reichs bis hin zu den Jahresberichten deutscher Handelskammern im ‚langen‘ 19. Jahrhundert. Allen genannten Digitalisierungsvorhaben ist der Anspruch gemeinsam, die jeweiligen statistischen Informationen unter Einsatz algorithmischer Tabellenextraktionsverfahren in einem für ihre wissenschaftliche Prozessierung geeigneten Dateiformat bereitzustellen – eine alles andere als leicht zu erfüllende Aufgabe.
Ungeachtet des rasanten technischen Fortschritts auf dem Feld automatischer Text- und Mustererkennung mithilfe Künstlicher Intelligenz muss nämlich die maschinelle Extraktion handschriftlicher wie gedruckter Tabelleninhalte angesichts der schieren Vielfalt und Varianz ihrer historischen Erscheinungsformen und gerade bei Werken mit unregelmäßigem Layout nach wie vor als unbewältigte Herausforderung gelten: „Table analysis is a perplexing task due to the colossal amount of diversity and asymmetry in tables.“ Dieser Befund eines unlängst erschienenen Übersichtsaufsatzes betrifft dabei keineswegs nur die Lösung des informatischen Problems, sondern gleichermaßen den Technologiezugang, wird doch forschungsseits nachdrücklich die Notwendigkeit eines niedrigschwelligen – möglichst webbasierten –, vor allem auch ohne Programmierkenntnisse und größeren Kostenaufwand zu nutzenden Angebots zur automatischen Erkennung beliebiger tabellarischer Quellenbestände (nicht nur) zur Wirtschafts- und Sozialgeschichte angemahnt.
Beide Dimensionen dieses Desiderats standen im Fokus des von der Staatsbibliothek zu Berlin gemeinsam mit der Professur für Digitale Geschichtswissenschaften der Universität Bamberg im Verbund mit der NFDI4Memory organisierten Workshops Tabellarische Quellen zwischen Geschichtswissenschaften und Digital Humanities. Denn die mit knapp 50 vor Ort bzw. virtuell Teilnehmenden erfreulich gut besuchte hybride Veranstaltung hatte sich nicht nur zum Ziel gesetzt, den aktuellen Forschungs- und Entwicklungsstand im Bereich der maschinellen Extraktion historischer Tabelleninhalte zu vermessen, sondern darüber hinaus auch den Auftakt zu einem integrativen Dialogprozess zu geben. Dieser soll geschichts- wie informatikwissenschaftlich Forschende ebenso einbeziehen wie digitalisierende Sammlungseinrichtungen – kurzum: alle Personen mit Interesse am Thema – und idealerweise im kooperativen Betrieb der so dringlich gewünschten Serviceinfrastruktur münden. Neben der Vorstellung von Individuallösungen zur Bearbeitung spezifischer historischer Tabellentypen ging es in dem Workshop zugleich um generalisierende Betrachtungen wie auch um ethische Fragen – namentlich im Hinblick auf die Gefahr der Elitebildung als Resultat der durchaus prohibitiven Kosten des Zugangs zu avancierten Sprach- und Vision-Language-Modellen.
Mit einem Plädoyer von Werner Scheltjens für die genetische Analyse historischer Tabellen – nicht zuletzt als Beitrag zur Optimierung der für die Layout-, Struktur und Inhaltserkennung eingesetzten Algorithmen – startete der Workshop in seinen Vortragsteil, an den sich ein nachmittäglicher Praxisblock mit konkreten Einblicken in Tabellentranskription und -extraktion mit unterschiedlichen Ansätzen anschließen sollte. Am Beispiel der Sundzollregister und ihrer tabellarischen Verdichtung machte Scheltjens deutlich, dass nicht nur die visuelle Grammatik von Tabellen außerordentlich vielfältig sein kann, sondern bereits die bloße Entwicklung einer (maschinenlesbaren) Taxonomie ihrer so vielfältigen historischen Erscheinungsformen eine echte Herausforderung darstellt.

Im Anschluss an diese kulturgeschichtliche Perspektive richtete Jan Kamlah (Universitätsbibliothek Mannheim) den Blick auf die praktische Erschließungsarbeit und berichtete aus einem laufenden Werkstattprozess über die Herausforderungen der maschinellen Aufbereitung wirtschaftshistorischer Tabellenbestände im Rahmen des eingangs angesprochenen finanzhistorischen Langfristvorhabens. Die Entwicklungen in der Dokumenterkennung, die Kamlah in einzelnen Stationen nachzeichnete, eröffnen in diesem Bereich neue Möglichkeiten, werfen zugleich aber auch Fragen auf, was etwa bisher etablierte Datenformate angeht.
Frank Puppe und Luzian Uihlein (Universität Würzburg) stellten – in Zusammenarbeit mit Tobias Gebel (Deutsches Institut für Wirtschaftsforschung Berlin) – anschließend Ansätze zur digitalen Bereitstellung der statistischen Inhalte der ebenfalls bereits erwähnten DIW-Wochenberichte aus den Jahren 1928 bis 1968 vor. Die umfangreichen und komplexen Tabellen profitieren insbesondere bei der Verarbeitung mit Vision Language Modellen von ihrer Zerlegung in mehrere Einzelteile, die nach der Erkennung wieder zur vollständigen Tabelle zusammengesetzt werden. Neben Tests diverser aktueller Modelle (und deren Kombination) sowie der Entwicklung von praktischen Tools zur schnellen Evaluation der Extraktionsergebnisse konnte aus dem Projekt insbesondere von Versuchen berichtet werden, sich bei der Extraktion der Tabelleninhalte noch weiter von Layout und Format der gedruckten Vorlage zu lösen und stärker die semantische Dimension in den Vordergrund zu stellen – eine allerdings hochkomplexe Aufgabe, wenn beispielsweise auch Fußnoten in der Tabelle deren genaue Interpretation beeinflussen.
Corwin Schnell (Universitätsbibliothek Tübingen) widmete sich einer weiteren Quellengattung, die ebenfalls in Tabellenform vorliegt: Die Erkennung und Rekonstruktion tabellarischer Strukturen in historischen Zuwachsverzeichnissen, wie sie etwa in Bibliotheken und anderen Kulturerbeeinrichtungen massenhaft zu finden sind, verspricht neue Möglichkeiten etwa für die Provenienzforschung. Die Gattung (meist handschriftlich, nicht immer einheitlich, geprägt von Wiederholungszeichen, etc.) hält aber ebenso spezifische Herausforderungen bereit. Auch in diesem Projekt zeigte sich, dass insbesondere die geschickte Verbindung eher ‚klassischer‘ Wege (Segmentierung und anschließende Texterkennung mit dezidierten Modellen) mit der Erkennung der Dokumente in ihrer Gesamtheit mittels Vision Language Modellen vielversprechend ist.
Nach der Mittagspause legten zwei weitere Vorträge den Fokus bereits auf die praktische Umsetzung und konkrete Tools bzw. Entwicklungen. Sebastian Geschonke (Humboldt-Universität zu Berlin) stellte mit dem „Image Table Preditor – Predictor und Editor“ ein Tool zur KI-gestützten Erschließung von Tabellen vor, das die gesamte Pipeline von der Beschreibung und semantischen Strukturierung der Tabelle über die Segmentierung und Texterkennung bis hin zur manuellen Korrektur und zum Export abdeckt. Auch hier besteht die Möglichkeit, unterschiedliche Modelle parallel zum Einsatz zu bringen, deren jeweilige Ergebnisse abzugleichen und ggf. manuell nachzukorrigieren.
Den Vortragsteil beschloss Lorenz Hufe (Fraunhofer Heinrich-Hertz-Institut für Nachrichtentechnik Berlin / University of Oxford) mit einer Vorstellung des Tools Chronos: The AI Co-Historian. Die rasante Entwicklung multimodaler Modelle und agentischer Fähigkeiten ermöglicht schon heute die Erforschung großer Mengen historischer Quellen. Mithilfe von Werkzeugen wie Chronos soll dies künftig vollständig natürlichsprachig und ohne technische Expertise möglich werden, während der/die historisch arbeitende Wissenschaftler*in als Co-Scientist das Verfahren und die Ergebnisse kritisch überwacht und begleitet.
Der Nachmittag stand dann noch stärker im Zeichen der Praxis: Unter dem Motto Bring Your Own Table wurden ausgewählte Tabellen gemeinsam annotiert und extrahiert. Tim Westphal (Berlin-Brandenburgische Akademie der Wissenschaften) stellte dabei eine Erweiterung von eScriptorium zur Annotation tabellarischer Strukturen samt Erprobung verschiedener Modellarchitekturen vor, während Roman Kuhn (Stabi Lab) Wege der Tabellenerkennung und -korrektur mit Chandra (datalab) in Kombination mit Marimo-Notebooks demonstrierte.
Die Veranstaltung endete mit einer Abschlussdiskussion im Plenum. Dabei standen neben der eingangs bereits erwähnten Frage nach der Zugänglichkeit von Praxiswissen und (computationeller oder finanzieller) Ressourcen auch die (Weiter-)Entwicklung von Standards und Datenformaten, von realistischen und praxisnahen Benchmarks und Datensets im Zentrum. Denn bei aller angestrebten Generizität von Tools, Modellen und Methoden: Die praktische Evaluation sollte möglichst konkret und bedarfsorientiert erfolgen.

Doch damit soll der Austausch keinesfalls abbrechen, denn dieser Workshop ist – wie gesagt – nicht als singuläre Veranstaltung zu verstehen, sondern ausdrücklich als eine für alle offene Einladung, zum Thema der maschinellen Extraktion historischer Tabelleninhalte miteinander ins Gespräch zu kommen, um zu bleiben. Dabei wollen wir Interesse aus den unterschiedlichsten Kontexten extrahieren und auf dem Weg zu unserem hochambitionierten Fernziel ganz verschiedene Zwischenstationen ansteuern – etwa materialspezifische Benchmarks, Ground Truth-Datensets oder Hackathons.
Sie wollen sich unserer Reisegruppe anschließen? Prima, dann schreiben Sie dazu bitte einfach zwei Zeilen (oder Spalten) an: lab@sbb.spk-berlin.de. Eine strukturierte Antwort von unsrer Seite ist Ihnen gewiss!



