• BLOG-NETZWERK FÜR FORSCHUNG UND KULTUR
SBB aktuell
  • FOYER
  • SERVICE
  • IT-INNOVATION
  • WISSEN
  • FEUILLETON
  • Menü Menü

QURATOR: Digitale Kuratierung mit Künstlicher Intelligenz

05.06.2019/0 Kommentare/in Feuilleton, Foyer, IT-Innovation, SPK, Wissen/von Clemens Neudecker

Ein Beitrag aus unserer Reihe Künstliche Intelligenz zum Wissenschaftsjahr 2019

Angesichts des stark wachsenden und fragmentierten Informationsangebotes müssen Inhalte in immer kürzerer Zeit für die digitale Publikation aufbereitet und publiziert werden. Vor diesem Hintergrund beteiligt sich die Staatsbibliothek zu Berlin an dem vom Bundesministerium für Bildung und Forschung (BMBF) im Programm Unternehmen Region geförderten Forschungsprojekt QURATOR: Curation Technologies.

QURATOR will dazu beitragen, Kuratierungstätigkeiten und die Generierung digitaler Inhalte  durch Automatisierung hochwertiger, effizienter und kostengünstiger zu gestalten und Wissensarbeiter*innen bei der Kuratierung digitaler Inhalte zu unterstützen. Eine wesentliche Grundlage dafür bilden Methoden auf Grundlage von Sprach- und Wissenstechnologien, Maschinellem Lernen (ML) und Künstlicher Intelligenz (KI).

Welche Rolle die Staatsbibliothek zu Berlin in diesem Projekt spielt, erläutert Clemens Neudecker, Forschungsreferent in der Generaldirektion, im Interview:

Woran arbeitet die Staatsbibliothek zu Berlin im Projekt QURATOR?

Die Staatsbibliothek zu Berlin digitalisiert alle Dokumente aus ihrem urheberrechtsfreien Bestand und stellt diese online zur Verfügung. Bevor man mit digitalisierten Quellen aber genauso komfortabel arbeiten kann, wie mit digital-born Dokumenten, sind zahlreiche komplexe Verarbeitungsschritte und technische Herausforderungen zu meistern. Im QURATOR Teilprojekt „Automatisierte Kuratierungstechnologien für das digitalisierte kulturelle Erbe“ beschäftigt sich die Staatsbibliothek zu Berlin mit zwei dieser grundsätzlichen Herausforderungen: Zum einen soll die Qualität der Digitalisierung durch KI-basierte Verfahren  verbessert werden, zum anderen soll die Effizienz der Kuratierung mithilfe automatisierter Verfahren deutlich steigen. Ziel ist es, dass künftig mehr Dokumente schneller und besser erschlossen und damit auch leichter recherchierbar werden.

Welche Anwendungsszenarien werden konkret entwickelt?

Konkret haben wir in QURATOR mit den Arbeiten an drei Kernaufgaben begonnen:

  1. Für die Qualitätsverbesserung ist es wichtig, überhaupt erst einmal zu verstehen, wo die Probleme auftreten und welche Stellschrauben zur Verfügung stehen. So werden in einem ersten Schritt sämtliche Metadaten und Volltexte der an der Staatsbibliothek zu Berlin vorhandenen Digitalisate untersucht um durch Clustering und Profiling Problemklassen zu identifizieren. In einem nächsten Schritt werden die für die Problemklassen entscheidenden Merkmale extrahiert und spezifisch dafür Lösungen entwickelt.
  2. Die Strukturerkennung stellt einen weiteren entscheidenden Schritt in der Dokumentenanalyse dar. Hierbei geht es darum Strukturen des Layout wie bspw. Spalten, Überschriften, Marginalien und dergleichen zu erkennen und als solche zu klassifizieren. Dafür werden aktuell Convolutional Neural Networks (CNN) auf der Basis von ResNet-50 trainiert.
  3. Auch im Bereich der Eigennamenerkennnung (Named Entity Recognition, NER) nutzen wir die Möglichkeiten der KI. Während bisherige Ansätze eher statistisch oder regelbasiert arbeiten, setzen wir hierfür auf Bidirectional Encoder Representations from Transformers (BERT), ein von Google auf Millionen von Texten vortrainiertes Neuronales Netz bzw. Modell, das nun auf den Digitalisaten der Staatsbibliothek zu Berlin für die Besonderheiten der historischen Rechtschreibung im Deutschen nachtrainiert wird.

Welche Innovationen verbinden sich damit?

Die zu erwartenden technologischen Innovationen bestehen in erster Linie darin, die vielversprechenden Ansätze aus dem Bereich der KI/des maschinellen Lernens auf die besonderen Anforderungen von historischen Dokumenten zu adaptieren. Da hierbei insbesondere die Verfügbarkeit von großen Mengen von Trainingsdaten eine wichtige Rolle spielt, ist die Staatsbibliothek zu Berlin aber mit aktuell rund 2,5 PetaBytes an Daten gut gerüstet.

Aktuell arbeiten wir bereits in weiteren Forschungsprojekten mit Technologien wie Künstlicher Intelligenz – so z.B. in dem von der Deutschen Forschungsgemeinschaft (DFG) geförderten Projekt OCR-D. Dort werden momentan im Bereich der Texterkennung (OCR) dank KI Durchbrüche erzielt, die vor wenigen Jahren noch undenkbar waren, wie bspw. die qualitativ hochwertige Verarbeitung von historischen Drucken oder sogar die automatische Erkennung von Handschriften.

Wie sieht die Bibliothek der Zukunft aus?

Vom Bücherspeicher zur Informationsinfrastruktur: Bibliotheken sind wie kaum ein anderes Feld vom digitalen Wandel betroffen. Die Digitale Transformation krempelt dabei viele etablierte Geschäftsprozesse einer Bibliothek grundlegend um. An die Stelle von unstrukturierten Daten sollen schlussendlich strukturierte Inhalte treten.

Darüber hinaus gibt es mit dem Forschungsbereich der „Digital Humanities“ seit einigen Jahren einen stark wachsenden Kreis von Forscher*innen, die mit großen Mengen von digitalisierten Beständen aus dem Kulturbereich und digitalen Methoden an neuen Forschungsfragen arbeiten. Die Staatsbibliothek zu Berlin erweitert hier konsequent ihre Kompetenzen und baut auch entsprechende Partnerschaften auf und aus.

Vorschau: „Von der Zukunft zurück in die Vergangenheit: Im nächsten Beitrag beleuchten wir die Geschichte der Automaten und den Maschinenglauben der Menschen aus der Frühen Neuzeit – sozusagen die ersten Experimente auf dem Weg zur Künstlichen Intelligenz.“

Schlagworte: Blogreihe, Künstliche Intelligenz, QURATOR, Wissenschaftsjahr 2019
Eintrag teilen
  • Teilen auf Facebook
  • Teilen auf X
  • Auf WhatsApp teilen
  • Teilen auf Pinterest
  • Teilen auf LinkedIn
  • Teilen auf Tumblr
  • Teilen auf Vk
  • Teilen auf Reddit
  • Per E-Mail teilen
https://blog.sbb.berlin/wp-content/uploads/csm_Graphic_qurator_fceb51a6a5.jpg 522 928 Clemens Neudecker https://blog.sbb.berlin/wp-content/uploads/stabi-logo-kante.png Clemens Neudecker2019-06-05 16:27:522026-06-24 09:57:02QURATOR: Digitale Kuratierung mit Künstlicher Intelligenz
Das könnte Sie auch interessieren
Copyright United States public domain, [U.S. Air Force photo by Paul Ridgeway ] Der autonome Militärroboter
"Der Philosoph Pyrrhon in stürmischer See"").-(Diogenes Laertius, Book IX, 61-108, On Pyrrho). Illumination, first quarter of 16th c., Petrarch Master.Quelle: Britannica ImageQuest. Copyright: akg Images / Universal Images GroupCopyright: akg Images / Universal Images Group Meer oder weniger Meer in der Literatur
“Texte aufräumen” – die ersten CrossAsia N-Gramm-Pakete stehen zum Download bereit
Die ungeheu(e)ren Dimensionen der Meere
License: Creative Commons 4.0 BY-NC „Artificial Morality“ oder: Können und sollen Maschinen moralisch handeln?
The Next Rembrandt by ING Group (CC BY 2.0), via flickr; Lizenz: https://creativecommons.org/licenses/by/2.0/; Quelle: https://www.flickr.com/photos/inggroup/26192277342/in/photostream/CC BY 2.0 ING Group Künstliche Intelligenz in Kunst und Kultur
Public Domain Mit Maschinen spielen – Lust und Frust in Zeiten der Künstlichen Intelligenz
Inselbücher machen Inselstädte
0 Kommentare

Ihr Kommentar

An Diskussion beteiligen?
Hinterlassen Sie uns einen Kommentar!

Schreiben Sie einen Kommentar Antworten abbrechen

Ihre E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert.

Search Search

Kommentare:

  • Hassan Warraich bei Wissenshunger stillen ohne Krümel | Feed Your Hunger for Knowledge — Without the Crumbs
  • Bianca Henn-Hoffmann bei Fair bleiben – Pausenscheibe nutzen – Plätze teilen | Stay fair – Use the Study Break Disc – Share Your Desks
  • Lütkemeier bei Fair bleiben – Pausenscheibe nutzen – Plätze teilen | Stay fair – Use the Study Break Disc – Share Your Desks
  • H. Dembowski bei Reden über Rodrian
  • Ulrike Rodrian bei Reden über Rodrian

Schlagwörter

Ausbildung Ausleihe Ausstellung Benutzung Benutzungseinschränkung Bilderbuch Buchpatenschaft CrossAsia Datenbank digitale Lektüretipps Digitalisierung E.T.A. Hoffmann Fachinformation Freunde der Staatsbibliothek Geschichte Hinweis Import Jugendbuch Kinderbuch Kulturelles Erbe Lesesaal Martin Luther Materialität Musik Osteuropa Presse Promovierende Provenienzforschung Recherche Recht Rechtsforschung Rechtswissenschaften Reformation Restaurierung sbb online offen Service Servicezeiten Slawistik Stipendienprogramm Werkstattgespräch Wissenswerkstatt Workshop Zeitschriftendatenbank Zeitungen Öffnungszeiten

Unsere Blogs

  • E. T. A. HOFFMANN PORTAL
  • FEUILLETON
  • FOYER
  • FREUNDE DER BIBLIOTHEK
  • HISTORISCHE DRUCKE
  • INKUNABELN
  • IT-INNOVATION
  • KARTEN
  • MUSIK
  • ORIENT
  • PODCAST
  • PRESSE
  • SERVICE
  • TERMINE
  • WISSEN

Suche über alle Beiträge:

Search Search

Folgen Sie uns auf Instagram

Folgen Sie uns auf Bluesky

Folgen Sie uns auf Mastodon

Besuchen Sie uns auf Youtube

ARCHIV ALLER BLOGBEITRÄGE

Zum Kalender
© Copyright - Staatsbibliothek zu Berlin – Preußischer Kulturbesitz
  • RSS-Feeds abonnieren
  • Impressum
  • Datenschutzerklärung
  • Erklärung zur Barrierefreiheit
  • Barriere melden
Link to: Neuerwerbung: Originalillustrationen von Wilhelm Heise zu E.T.A. Hoffmanns ‚Das Fräulein von Scuderi‘ Link to: Neuerwerbung: Originalillustrationen von Wilhelm Heise zu E.T.A. Hoffmanns ‚Das Fräulein von Scuderi‘ Neuerwerbung: Originalillustrationen von Wilhelm Heise zu E.T.A. Hoffmanns ‚Das... Link to: Klimasituation in unseren Lesesälen Link to: Klimasituation in unseren Lesesälen Lesesäle der Staatsbibliothek zu Berlin-PK - Lizenz CC BY-SA-NBKlimasituation in unseren Lesesälen
Nach oben scrollen Nach oben scrollen Nach oben scrollen