Automatisierte Datenextraktion im Rahmen des FWF-Projekts 'Digitale Erschließung des Schematismus'

Fuente: Zenodo
Gespeichert in:
Bibliographische Detailangaben
1. Verfasser: Ortbauer, Bernhard
Format: Recurso digital
Veröffentlicht: Zenodo 2026
Schlagworte:
Online-Zugang:
Tags: Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
_version_ 1866901579551997952
author Ortbauer, Bernhard
author_facet Ortbauer, Bernhard
contents Die bestehende Datenextraktion im FWF-Projekt 'Digitale Erschließung des Schematismus' liefert eine sehr akkurate Trennung der Überschriften und Paragraphen sowie eine hochpräzise OCR des komplexen Druckwerks dieses umfangreichen Beamtenalmanachs der Habsburgermonarchie. Da dies allerdings nicht ausreicht um die implizite Baumstruktur vollständig in eine vernetzte Personendatenbank zu überführen, soll meine Dissertation die Datenextraktion weiter vorantreiben. Unter der Prämisse, dass aufeinander aufbauende Informationslayer erzeugt werden, sollen zunächst alle visuellen Merkmale einer Seite erfasst werden, bevor über NER der Textinhalt semantisch analysiert und aus diesen Informationen eine Graphdatenbank erzeugt wird. Mit dem Ziel einer granularen Disambiguierung der Überschriftenstile, wird aktuell das Finetuning von Transformer-Modellen durch Contrastive Learning vorbereitet. Diese Modelle sollen dann für paarweise Vergleiche sder Überschriften herangezogen werden. Ziel ist eine möglichst genaue Zuordnung jeder einzelnen extrahierten Person zu den entsprechenden Stellen und den jeweils übergeordneten Verwaltungseinheiten.
format Recurso digital
id zenodo_https___doi_org_10_5281_zenodo_18696163
institution Zenodo
language
publishDate 2026
publisher Zenodo
record_format zenodo
spellingShingle Automatisierte Datenextraktion im Rahmen des FWF-Projekts 'Digitale Erschließung des Schematismus'
Ortbauer, Bernhard
DHd2026
Paper
Doctoral Consortium
Datenextraktion
Layouterkennung
Computer Vision
Habsburgermonarchie
Beamtengeschichte
Die bestehende Datenextraktion im FWF-Projekt 'Digitale Erschließung des Schematismus' liefert eine sehr akkurate Trennung der Überschriften und Paragraphen sowie eine hochpräzise OCR des komplexen Druckwerks dieses umfangreichen Beamtenalmanachs der Habsburgermonarchie. Da dies allerdings nicht ausreicht um die implizite Baumstruktur vollständig in eine vernetzte Personendatenbank zu überführen, soll meine Dissertation die Datenextraktion weiter vorantreiben. Unter der Prämisse, dass aufeinander aufbauende Informationslayer erzeugt werden, sollen zunächst alle visuellen Merkmale einer Seite erfasst werden, bevor über NER der Textinhalt semantisch analysiert und aus diesen Informationen eine Graphdatenbank erzeugt wird. Mit dem Ziel einer granularen Disambiguierung der Überschriftenstile, wird aktuell das Finetuning von Transformer-Modellen durch Contrastive Learning vorbereitet. Diese Modelle sollen dann für paarweise Vergleiche sder Überschriften herangezogen werden. Ziel ist eine möglichst genaue Zuordnung jeder einzelnen extrahierten Person zu den entsprechenden Stellen und den jeweils übergeordneten Verwaltungseinheiten.
title Automatisierte Datenextraktion im Rahmen des FWF-Projekts 'Digitale Erschließung des Schematismus'
topic DHd2026
Paper
Doctoral Consortium
Datenextraktion
Layouterkennung
Computer Vision
Habsburgermonarchie
Beamtengeschichte
url https://doi.org/10.5281/zenodo.18696163