• BLOG-NETZWERK FÜR FORSCHUNG UND KULTUR
SBB aktuell
  • FOYER
  • SERVICE
  • IT-INNOVATION
  • WISSEN
  • FEUILLETON
  • Menü Menü
Bild1

Mit KI zum Durchbruch bei der OCR für historische Drucke

17.04.2019/0 Kommentare/in Feuilleton, Foyer, IT-Innovation, SPK, Wissen/von Clemens Neudecker

Ein Beitrag aus unserer Reihe Künstliche Intelligenz zum Wissenschaftsjahr 2019

Texterkennung bzw. OCR (Optical Character Recognition) stellt einen entscheidenden Schritt dar, um von Digitalisaten, d.h. gescannten Bildern von (Buch-)Seiten, zu durchsuchbarem, elektronischen Volltext zu gelangen. Während OCR für zeitgenössische Dokumente inzwischen beinahe fehlerfrei funktioniert, sahen die mit kommerziellen OCR-Produkten erzielbaren Ergebnisse bei historischen Drucken und Frakturschriften bislang weniger zufriedenstellend aus.

OCR Courante uyt Italien, Duytslandt, &c.

OCR Ergebnis für die „Courante uyt Italien, Duytslandt, &c.“ (1618)

OCR für historische Dokumente

Zahlreiche Forschungsprojekte haben sich daher mit der Weiterentwicklung von OCR-Verfahren spezifisch für historische Drucke beschäftigt, so z.B. IMPACT, eMOP, (In)Venod uvm. Den meisten dieser Initiativen ist allerdings gemein, dass sie zu früh endeten um vom neuerlichen Boom der Künstlichen Intelligenz (bzw. des maschinellen Lernens) zu profitieren. Im Bereich der OCR kann dafür 2016 als das entscheidende Jahr gelten: zwei „Klassiker“ der Open Source OCR, Tesseract und OCRopus wurden grundlegend erneuert und auf KI-basierte Verfahren in Form sog. rekurrenter neuronaler Netze (RNN) in Kombination mit LSTM (Long short-term memory) umgestellt. Tesseract Hauptentwickler Ray Smith berichtete dazu in einem Tutorial im DAS2016 Workshop, während parallel Uwe Springmann zeigte, welche Erkennungsqualität mit OCRopus und Training inzwischen auch für historische Materialien möglich ist.

Grundsätzlich besteht ein künstliches Neuronales Netz – analog zum menschlichen Gehirn – aus einer Anzahl von miteinander vernetzten Neuronen (Rezeptoren). Entscheidend für die Lernfunktion eines Neuronalen Netz ist dabei dessen Topologie, also die Struktur des Netzes. Darunter versteht man einerseits die Anzahl und Typologie der Neuronen und ihre Verbindungen untereinander als auch die Verbindungen der Neuronen durch verschiedene Schichten hindurch. Der Nutzen von Neuronalen Netzen ist vor allem dann groß, wenn kein oder nur geringes Wissen über einen Lösungsweg vorliegt. In einem solchen Fall wird das Neuronale Netz mit manuell erzeugten Daten (Ground Truth) trainiert und das Neuronale Netz lernt selbstständig einen Lösungsweg um von den Eingabedaten zu den Ground Truth Daten zu gelangen.

Das Video zeigt, wie ein neuronales Netz nach und nach den in der obersten Zeile (invertiert) dargestellten Text erkennen lernt

Durchbrüche in der OCR durch KI

Ein entscheidender Durchbruch der KI-basierten OCR ist der Wechsel von „segmentatierungsbasierten“ zu sog. „segmentierungsfreien“ Ansätzen. Was genau ist damit gemeint?

Klassische Verfahren beginnen mit der Unterteilung einer Seite in Bereiche („Blöcke“ bzw. „Regionen“ oder auch „Zonen“) die Text enthalten sowie Bereiche ohne Text (bspw. Abbildungen, Verzierungen usw.). Die Textbereiche werden anschließend weiter in einzelne Zeilen unterteilt („Zeilensegmentierung“), diese wiederum in Wörter („Wortsegmentierung“) und in einzelne Zeichen („Zeichensegmentierung“). Die OCR gleicht dann die isolierten Buchstaben mit einer Datenbank von hinterlegten Mustern von Zeichen ab, um das wahrscheinlichste Zeichen zu bestimmen. Die „segmentierungsfreien“ Verfahren hingegen betrachten immer den gesamten Text einer Zeile und profitieren dadurch von zusätzlichen Kontextinformationen wie bspw. anderen Wörtern in der selben Zeile.

https://www.slideshare.net/icaruseu/coopreadconvention-marburg-roger-labahn-university-of-rostock-de-handwritten-text-recognition-key-concepts

Eine weitere Neuerung von KI-basierten OCR-Verfahren ist der Verzicht auf ein Sprachmodell. Klassische OCR verwendet Lexika und Wortfrequenzlisten um durch die optische Erkennung gewonnenen Wörter zusätzlich abzusichern. Wie jedoch Ray Smith 2011 auf der ICDAR-Konferenz zeigte, bringen insbesondere frequenzbasierte Sprachmodelle bei bereits guten Zeichenklassifikationen mehr Schaden als Nutzen. Gerade für historische Drucke, die sich durch uneinheitliche Orthografie, häufige Eigennamen und variierendes Schriftbild auszeichnen, kann eine sprachbasierte Nachkorrektur sogar zu einer „Verschlimmbesserung“ führen, die eine wissenschaftliche Nachnutzung unmöglich macht.

OCR-D: Weiterentwicklung von OCR für historische Drucke

Um die neuen Möglichkeiten KI-basierter Verfahren rund um OCR für historische Drucke auszuloten und nachnutzbar zu machen fand sich dank DFG-Förderung in 2015 die „Koordinierte Förderinitiative zur Weiterentwicklung von Verfahren für die Optical-Character-Recognition“, kurz OCR-D, zusammen. 2015 – 2017 wurden in einer ersten Projektphase Bedarfe für die Weiterentwicklung der automatischen Texterkennung analysiert. Die ermittelten Anforderungen mündeten im März 2017 in der DFG-Ausschreibung „Skalierbare Verfahren der Text- und Strukturerkennung für die Volltextdigitalisierung historischer Drucke“. Die Bewilligung von acht Modulprojekten zum Dezember 2017 markierte den Beginn der zweiten Projektphase, in der aktuell die Modulprojekte verschiedene Prototypen entwickeln. Dabei finden KI-basierte Methoden gleich in mehreren OCR-D Modulprojekten Verwendung:

  • Neuronales Netz für die automatisierte Nachkorrektur von OCR Ergebnissen im Modulprojekt der Universität Leipzig, Institut für Automatische Sprachverarbeitung
  • Rekurrentes Neuronales Netz mit LSTM für die Texterkennung mit Tesseract Version 4 im Modulprojekt der Universitätsbibliothek Mannheim
  • Neuronales Netz für die Erkennung von Schriftarten im gemeinsamen Modulprojekt von Universität Erlangen & Universität Mainz
  • Trainingsinfrastruktur für OCR basierend auf Neuronalen Netzen im Modulprojekt der Universität Leipzig, Institut für Digital Humanities

Referenzen:

  • Thomas M. Breuel, Adnan Ul-Hasan, Mayce Ali Al-Azawi, Faisal Shafait: High-Performance OCR for Printed English and Fraktur Using LSTM Networks
  • Christian Reul, Uwe Springmann, Christoph Wick, Frank Puppe: State of the Art Optical Character Recognition of 19th Century Fraktur Scripts using Open Source Engines

Vorschau: Mit unserem nächsten Beitrag reisen wir nach Ostasien!

Schlagworte: Blogreihe, Künstliche Intelligenz, OCR, Wissenschaftsjahr 2019
Eintrag teilen
  • Teilen auf Facebook
  • Teilen auf X
  • Auf WhatsApp teilen
  • Teilen auf Pinterest
  • Teilen auf LinkedIn
  • Teilen auf Tumblr
  • Teilen auf Vk
  • Teilen auf Reddit
  • Per E-Mail teilen
https://blog.sbb.berlin/wp-content/uploads/artificial-intelligence-3685928_1280.png 853 1280 Clemens Neudecker https://blog.sbb.berlin/wp-content/uploads/stabi-logo-kante.png Clemens Neudecker2019-04-17 14:46:032026-06-24 09:57:06Mit KI zum Durchbruch bei der OCR für historische Drucke
Das könnte Sie auch interessieren
QURATOR 2020 – Konferenz zu Digitalen Kuratierungstechnologien
Die ungeheu(e)ren Dimensionen der Meere
The Next Rembrandt by ING Group (CC BY 2.0), via flickr; Lizenz: https://creativecommons.org/licenses/by/2.0/; Quelle: https://www.flickr.com/photos/inggroup/26192277342/in/photostream/CC BY 2.0 ING Group Künstliche Intelligenz in Kunst und Kultur
Automaten und künstliche Menschen bei E.T.A. Hoffmann – „eine beunruhigende Faszination“
Susanne Henschel Künstliche Intelligenz – beim Wort genommen
„Acht Schwestern“ – Die letzte Ära der großen Frachtsegler
ALTO XML Schema SBB engagiert sich im ALTO Board
"Andaman-Inseln - Fischfang mit Bogen." (um 1895), aus "Malerische Studien. Eine Reise um die Welt in 200 farbigen Photographien nach Naturaufnahmen", Leipzig: R. P. Koehler o.J. (1900); Bd. 2 | © bpk Meeresbuffet – Versorgung und Ernährung aus dem Meer
0 Kommentare

Ihr Kommentar

An Diskussion beteiligen?
Hinterlassen Sie uns einen Kommentar!

Schreiben Sie einen Kommentar Antworten abbrechen

Ihre E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert.

Search Search

Kommentare:

  • Anna bei Neue Trinkwasserspender für alle | New Drinking Water Dispensers for All
  • Wanja Nitzsche bei Reden über Rodrian
  • SuK bei Wissenshunger stillen ohne Krümel | Feed Your Hunger for Knowledge — Without the Crumbs
  • Thomas Parschik bei Tollkühne Frauen und Männer und fliegende Kisten
  • Benutzungskommunikation bei Wissenshunger stillen ohne Krümel | Feed Your Hunger for Knowledge — Without the Crumbs

Schlagwörter

Ausbildung Ausleihe Ausstellung Benutzung Benutzungseinschränkung Bilderbuch Buchpatenschaft CrossAsia Datenbank digitale Lektüretipps Digitalisierung E.T.A. Hoffmann Fachinformation Freunde der Staatsbibliothek Geschichte Hinweis Import Jugendbuch Kinderbuch Kulturelles Erbe Lesesaal Martin Luther Materialität Musik Osteuropa Presse Promovierende Provenienzforschung Recherche Recht Rechtsforschung Rechtswissenschaften Reformation Restaurierung sbb online offen Service Servicezeiten Slawistik Stipendienprogramm Werkstattgespräch Wissenswerkstatt Workshop Zeitschriftendatenbank Zeitungen Öffnungszeiten

Unsere Blogs

  • E. T. A. HOFFMANN PORTAL
  • FEUILLETON
  • FOYER
  • FREUNDE DER BIBLIOTHEK
  • HISTORISCHE DRUCKE
  • INKUNABELN
  • IT-INNOVATION
  • KARTEN
  • MUSIK
  • ORIENT
  • PODCAST
  • PRESSE
  • SERVICE
  • TERMINE
  • WISSEN

Suche über alle Beiträge:

Search Search

Folgen Sie uns auf Instagram

Folgen Sie uns auf Bluesky

Folgen Sie uns auf Mastodon

Besuchen Sie uns auf Youtube

ARCHIV ALLER BLOGBEITRÄGE

Zum Kalender
© Copyright - Staatsbibliothek zu Berlin – Preußischer Kulturbesitz
  • RSS-Feeds abonnieren
  • Impressum
  • Datenschutzerklärung
  • Erklärung zur Barrierefreiheit
  • Barriere melden
Link to: Scriptorium: Codicological and Paleographical Aspects of Islamic Manuscripts, with a Special Focus on Manuscript Notes Link to: Scriptorium: Codicological and Paleographical Aspects of Islamic Manuscripts, with a Special Focus on Manuscript Notes Scriptorium: Codicological and Paleographical Aspects of Islamic Manuscripts,... Link to: „Ich bin nach Weisheit weit umher gefahren“- ein Museum für Chamisso Link to: „Ich bin nach Weisheit weit umher gefahren“- ein Museum für Chamisso Chamisso Museum / Foto: Gabriele Kaiser, privatFoto: Gabriele Kaiser, privat„Ich bin nach Weisheit weit umher gefahren“- ein Museum für Ch...
Nach oben scrollen Nach oben scrollen Nach oben scrollen