KenPOS is a part-of-speech (POS) tagged corpus for Kenyan languages, featuring 156,994 tokens across four languages. The dataset provides manually annotated POS tags for low-resource Kenyan languages, enabling NLP research and applications.
Language
Code
Tokens
Sentences
Files
Unique POS Tags
Dholuo
dho
54,712
70
168
114
Lubukusu
lbk
51,900
154
62