Refine
Year of publication
Document Type
- Doctoral Thesis (914)
- Article (409)
- Contribution to a Periodical (142)
- Book (121)
- Working Paper (65)
- Part of a Book (51)
- Part of Periodical (43)
- Conference Proceedings (18)
- Other (16)
- Master's Thesis (11)
- Review (10)
- Habilitation (6)
- Course Material (3)
- Report (3)
- Retro digitized Object (3)
- Bachelor Thesis (2)
- Lecture (2)
- Examination Thesis (1)
- Magister's Thesis (1)
Keywords
- Deutschland (123)
- Luxemburg (73)
- Schüler (72)
- Schule (58)
- Stress (41)
- Rückmeldung (40)
- Unterricht (40)
- Mitbestimmung (37)
- Leistungsbewertung (36)
- Schülerpartizipation (34)
Institute
- Psychologie (231)
- Raum- und Umweltwissenschaften (215)
- Fachbereich 2 (190)
- Politikwissenschaft (171)
- Universitätsbibliothek (85)
- Fachbereich 4 (81)
- Rechtswissenschaft (77)
- Fachbereich 3 (68)
- Mathematik (68)
- Wirtschaftswissenschaften (66)
Wie viele retrodigitalisierte historische Wörterbücher sind auch die deutschsprachigen Dialektwörterbücher weitgehend isoliert voneinander und unverbunden im Web publiziert, obwohl sie ein großes Vernetzungspotential aufweisen. Als geeignete Plattform für die Verlinkung lexikalischer Ressourcen gilt das Linked Open Data (LOD) Paradigma. Die Abbildung von Semantik erfolgt hier nach dem Prinzip semantics by reference über die Verknüpfung der Lemmata mit einem ontologischen Konzept. Allerdings wurden bislang kaum retrodigitalisierte Wörterbücher als LOD aufbereitet, was insbesondere auf das Fehlen von überzeugenden automatisierten Methoden zur lexikalisch-semantischen Vernetzung zurückzuführen ist.
Am Beispiel der westmitteldeutschen Dialektwörterbücher sowie dem semantischen Feld Trinken erprobt die vorliegende Arbeit drei unterschiedliche Methoden für die Durchführung einer automatisierten Verknüpfung von Lemma-Bedeutungs-Paaren und Konzepten: (1) einen Ansatz, basierend auf einem ausdrucksseitigen Abgleich von Zeichenketten, (2) die Verwendung von Embeddings nach Finetuning des Sprachmodells ModernGBERT und (3) die Nutzung des LLMs Llama 3.3. Die Datenbasis für die Vernetzung und deren Evaluation wird durch ein Korpus mit Goldstandard-Annotation bereitgestellt. Ein projektspezifisches kontrolliertes Vokabular definiert die Konzepte, welche als Referenzebene der Verknüpfung sowie Schnittstelle zum Semantic Web fungieren.
Die beste Gesamtperformance erreicht die auf ModernGBERT basierende Methode: Sie klassifiziert 97% der Einträge korrekt ins semantische Feld, erreicht 94,55% Genauigkeit bei den generischen Wurzelkonzepten, 88,56% bei den Basiskonzepten und ordnet konkrete Konzeptbegriffe zu 91,78% korrekt zu (Top-3-Vorhersagen). Die Qualität der erzielten Ergebnisse eignet sich bereits ohne Nachbearbeitung zum Einsatz für eine konzeptbasierte Suche oder zur Exploration eines Wortfeldes. Für Kontexte, in denen eine möglichst fehlerlose Vernetzung notwendig ist, etwa im Semantic Web, bieten die erzeugten Konzeptverknüpfungen eine gute Grundlage für einen nachgelagerten Korrekturdurchgang.
Somit konnte eine praktikable Lösung für eine automatisierte semantische Vernetzung von Wörterbuchartikeln erarbeitet werden. Es eröffnet sich damit die Perspektive, lexikographische Daten – insbesondere solche aus vordigitaler Ära – als LOD miteinander zu vernetzen, wodurch diese einen onomasiologischen Zugang erhalten und sich neue Anwendungs- und Suchmöglichkeiten eröffnen.