Automatisierte Methoden zur konzeptbasierten Vernetzung historischer Wörterbücher als Linked Open Data: Möglichkeiten und Herausforderungen
- Wie viele retrodigitalisierte historische Wörterbücher sind auch die deutschsprachigen Dialektwörterbücher weitgehend isoliert voneinander und unverbunden im Web publiziert, obwohl sie ein großes Vernetzungspotential aufweisen. Als geeignete Plattform für die Verlinkung lexikalischer Ressourcen gilt das Linked Open Data (LOD) Paradigma. Die Abbildung von Semantik erfolgt hier nach dem Prinzip semantics by reference über die Verknüpfung der Lemmata mit einem ontologischen Konzept. Allerdings wurden bislang kaum retrodigitalisierte Wörterbücher als LOD aufbereitet, was insbesondere auf das Fehlen von überzeugenden automatisierten Methoden zur lexikalisch-semantischen Vernetzung zurückzuführen ist. Am Beispiel der westmitteldeutschen Dialektwörterbücher sowie dem semantischen Feld Trinken erprobt die vorliegende Arbeit drei unterschiedliche Methoden für die Durchführung einer automatisierten Verknüpfung von Lemma-Bedeutungs-Paaren und Konzepten: (1) einen Ansatz, basierend auf einem ausdrucksseitigen Abgleich von Zeichenketten, (2) die Verwendung von Embeddings nach Finetuning des Sprachmodells ModernGBERT und (3) die Nutzung des LLMs Llama 3.3. Die Datenbasis für die Vernetzung und deren Evaluation wird durch ein Korpus mit Goldstandard-Annotation bereitgestellt. Ein projektspezifisches kontrolliertes Vokabular definiert die Konzepte, welche als Referenzebene der Verknüpfung sowie Schnittstelle zum Semantic Web fungieren. Die beste Gesamtperformance erreicht die auf ModernGBERT basierende Methode: Sie klassifiziert 97% der Einträge korrekt ins semantische Feld, erreicht 94,55% Genauigkeit bei den generischen Wurzelkonzepten, 88,56% bei den Basiskonzepten und ordnet konkrete Konzeptbegriffe zu 91,78% korrekt zu (Top-3-Vorhersagen). Die Qualität der erzielten Ergebnisse eignet sich bereits ohne Nachbearbeitung zum Einsatz für eine konzeptbasierte Suche oder zur Exploration eines Wortfeldes. Für Kontexte, in denen eine möglichst fehlerlose Vernetzung notwendig ist, etwa im Semantic Web, bieten die erzeugten Konzeptverknüpfungen eine gute Grundlage für einen nachgelagerten Korrekturdurchgang. Somit konnte eine praktikable Lösung für eine automatisierte semantische Vernetzung von Wörterbuchartikeln erarbeitet werden. Es eröffnet sich damit die Perspektive, lexikographische Daten – insbesondere solche aus vordigitaler Ära – als LOD miteinander zu vernetzen, wodurch diese einen onomasiologischen Zugang erhalten und sich neue Anwendungs- und Suchmöglichkeiten eröffnen.
- Like many retro-digitized historical dictionaries, German-language dialect dictionaries are largely isolated from one another and published on the web without any links between them, even though they have great potential for networking. The Linked Open Data (LOD) paradigm is considered a suitable platform for linking lexical resources. Here, semantics are mapped according to the semantics-by-reference principle via the representation and linking of lemmas with an ontological concept. However, hardly any retrodigitized dictionaries have been processed as LOD to date, primarily due to the lack of effective automated methods for lexical-semantic networking. Using the example of dictionaries of West Central German dialects and the semantic field of drinking, this work tests three different methods for automatically linking lemma-definition pairs and concepts: (1) an approach based on string matching at the expression level, (2) the use of embeddings after finetuning the ModernGBERT language model, and (3) the use of the Llama 3.3 LLM. The database for the linking and its evaluation is provided by a corpus with groundtruth annotations. A project-specific controlled vocabulary defines the concepts that serve as the reference level for the linking and as an interface to the Semantic Web. The method based on ModernGBERT achieves the best overall performance: It correctly classifies 97% of entries into the semantic field, achieves 94.55% accuracy for generic root concepts, 88.56% for basic concepts, and correctly assigns concrete concept terms in 91.78% of the predicted top-3 results. The quality of the results achieved is already suitable for use in concept-based searches or for exploring a word field without post-processing. In contexts where error-free networking is necessary, such as the Semantic Web, the generated concept links provide a solid foundation for subsequent corrections. This has resulted in the creation of a practical solution for the automated semantic linking of dictionary entries. It paves the way for linking lexicographic data, especially from the pre-digital era, as Linked Open Data (LOD), providing onomasiological access and opening up new applications and search possibilities.
| Author: | Anne Klee |
|---|---|
| URN: | urn:nbn:de:hbz:385-1-29361 |
| Referee: | Christof Schöch |
| Advisor: | Christof Schöch, Susanne Kabatnik |
| Document Type: | Doctoral Thesis |
| Language: | German |
| Date of completion: | 2026/06/21 |
| Date of publication: | 2026/06/21 |
| Publishing institution: | Universität Trier |
| Granting institution: | Universität Trier, Fachbereich 2 |
| Date of final exam: | 2026/05/19 |
| Release Date: | 2026/07/10 |
| Tag: | Digitale Lexikographie; Large Language Models; Linked Open Data; Maschinelles Lernen; Semantische Vernetzung |
| Number of pages: | XIV, 353 Blätter |
| First page: | I |
| Last page: | 353 |
| Institutes: | Fachbereich 2 |
| Dewey Decimal Classification: | 0 Informatik, Informationswissenschaft, allgemeine Werke / 00 Informatik, Wissen, Systeme / 004 Datenverarbeitung; Informatik |
| 4 Sprache / 40 Sprache / 400 Sprache | |
| Licence (German): | CC BY: Creative-Commons-Lizenz 4.0 International |


