Logo Lanfrica

MigraAnno: Creating a topic-specific corpus from a large newspaper collection

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Bro
Éditeur:
Zenodo
Hôte:avatar

This poster presents MigraAnno, a topic-specific corpus of migration- and minority-related discourse extracted from Austrian newspapers (1703–1938) using seeded BERTopic modelling, human evaluation, and transformer-based relevancy classification. The resulting 96,871-sentence corpus is openly available and supports historical, linguistic, and computational research on migration and minority discourses.