Entity linking
Úvod
Výzkumný projekt na VUT FIT, který propojuje zmínky o osobách v korpusu OCR zpracovaných historických dokumentů. Data neobsahují žádné autoritní identifikátory (Wikidata, VIAF), takže znalostní bázi osob je potřeba postavit jen ze samotných zmínek.
Cíl projektu
Vytvořit kvalitní trénovací a testovací datovou sadu shluků osob a zmapovat, nakolik se dá věřit NER anotacím vytvořeným jazykovým modelem.
Můj přístup
Nejdřív analyzuji korpus (3 600 dokumentů, 2,8 GB) a kvalitu NER a indexuji ho do SQLite. Lokálně spuštěný LLM (Ollama / rozhraní kompatibilní s OpenAI) pak navrhne shluky zmínek jedné osoby, německé pasáže se přeloží a člověk návrhy zkontroluje ve webovém anotačním nástroji ve Svelte.
Výsledek
Opakovatelný postup od surových dat po zkontrolovanou datovou sadu, zdokumentovaný včetně architektonických rozhodnutí (ADR).