Klingt interessant? Das ist die konkrete Forschungsfrage:
Einsatz von LLMs zur Unterstützung von Dateneingabe, Datenvalidierung und Datenqualitätsanalyse
- In vielen Optimierungs- und Analyseanwendungen ist nicht die Modellierung, sondern bereits die strukturierte und qualitativ hochwertige Erfassung der Eingangsdaten ein zentraler Engpass.
- LLMs versprechen Unterstützung bei der Umwandlung unstrukturierter Informationen in strukturierte Eingaben sowie bei der automatischen Ableitung von Datenqualitätsregeln, ihre Zuverlässigkeit ist jedoch noch nicht hinreichend bewertet.
- Zu untersuchen ist, in welchen Schritten des Dateneingabe- und Datenqualitätsprozesses LLMs einen robusten Mehrwert liefern und welche Kontrollmechanismen dafür nötig sind.
Diese Methodik stellen wir uns vor:
- Entwicklung eines Prototyps, der unstrukturierte oder semi-strukturierte Eingaben in für OPTANO relevante Datenstrukturen überführt und potenzielle Qualitätsprobleme erkennt.
- Vergleich verschiedener Ansätze, z. B. reine Extraktion, regelgestützte Nachvalidierung, iteratives Self-Checking oder human-in-the-loop.
- Evaluation anhand von Genauigkeit, Vollständigkeit, Korrekturaufwand, Verarbeitungszeit und Nützlichkeit im praktischen Workflow
Diese Kenntnisse benötigts du:
- Gute Python-Kenntnisse und Interesse an Datenverarbeitung
- Grundkenntnisse in Data Engineering, Datenqualität oder Information Extraction
- Interesse an experimenteller Evaluation von LLM-Systemen