Automatisierte Datenextraktion im Rahmen des FWF-Projekts 'Digitale Erschließung des Schematismus'
Fuente:
Zenodo
Gespeichert in:
| 1. Verfasser: | |
|---|---|
| Format: | Recurso digital |
| Veröffentlicht: |
Zenodo
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
| _version_ | 1866901579551997952 |
|---|---|
| author | Ortbauer, Bernhard |
| author_facet | Ortbauer, Bernhard |
| contents | Die bestehende Datenextraktion im FWF-Projekt 'Digitale Erschließung des Schematismus' liefert eine sehr akkurate Trennung der Überschriften und Paragraphen sowie eine hochpräzise OCR des komplexen Druckwerks dieses umfangreichen Beamtenalmanachs der Habsburgermonarchie. Da dies allerdings nicht ausreicht um die implizite Baumstruktur vollständig in eine vernetzte Personendatenbank zu überführen, soll meine Dissertation die Datenextraktion weiter vorantreiben. Unter der Prämisse, dass aufeinander aufbauende Informationslayer erzeugt werden, sollen zunächst alle visuellen Merkmale einer Seite erfasst werden, bevor über NER der Textinhalt semantisch analysiert und aus diesen Informationen eine Graphdatenbank erzeugt wird. Mit dem Ziel einer granularen Disambiguierung der Überschriftenstile, wird aktuell das Finetuning von Transformer-Modellen durch Contrastive Learning vorbereitet. Diese Modelle sollen dann für paarweise Vergleiche sder Überschriften herangezogen werden. Ziel ist eine möglichst genaue Zuordnung jeder einzelnen extrahierten Person zu den entsprechenden Stellen und den jeweils übergeordneten Verwaltungseinheiten. |
| format | Recurso digital |
| id | zenodo_https___doi_org_10_5281_zenodo_18696163 |
| institution | Zenodo |
| language | |
| publishDate | 2026 |
| publisher | Zenodo |
| record_format | zenodo |
| spellingShingle | Automatisierte Datenextraktion im Rahmen des FWF-Projekts 'Digitale Erschließung des Schematismus' Ortbauer, Bernhard DHd2026 Paper Doctoral Consortium Datenextraktion Layouterkennung Computer Vision Habsburgermonarchie Beamtengeschichte Die bestehende Datenextraktion im FWF-Projekt 'Digitale Erschließung des Schematismus' liefert eine sehr akkurate Trennung der Überschriften und Paragraphen sowie eine hochpräzise OCR des komplexen Druckwerks dieses umfangreichen Beamtenalmanachs der Habsburgermonarchie. Da dies allerdings nicht ausreicht um die implizite Baumstruktur vollständig in eine vernetzte Personendatenbank zu überführen, soll meine Dissertation die Datenextraktion weiter vorantreiben. Unter der Prämisse, dass aufeinander aufbauende Informationslayer erzeugt werden, sollen zunächst alle visuellen Merkmale einer Seite erfasst werden, bevor über NER der Textinhalt semantisch analysiert und aus diesen Informationen eine Graphdatenbank erzeugt wird. Mit dem Ziel einer granularen Disambiguierung der Überschriftenstile, wird aktuell das Finetuning von Transformer-Modellen durch Contrastive Learning vorbereitet. Diese Modelle sollen dann für paarweise Vergleiche sder Überschriften herangezogen werden. Ziel ist eine möglichst genaue Zuordnung jeder einzelnen extrahierten Person zu den entsprechenden Stellen und den jeweils übergeordneten Verwaltungseinheiten. |
| title | Automatisierte Datenextraktion im Rahmen des FWF-Projekts 'Digitale Erschließung des Schematismus' |
| topic | DHd2026 Paper Doctoral Consortium Datenextraktion Layouterkennung Computer Vision Habsburgermonarchie Beamtengeschichte |
| url | https://doi.org/10.5281/zenodo.18696163 |