Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

KenPos: Kenyan Languages Part of Speech Tagged dataset

Domain:

natural language processing

Record type:

dataset
This project developed a Part of Speech (POS) Tagged dataset of 2 languages in Kenya: Dholuo and 3 Luhya dialects (Lumarachi, Lulogooli, and Lubukusi). The project tagged approximately 143,000 words, which includes about 50,000 words for Dholuo, 27,900 words for Lumarachi, 34,300 words for Logooli, and 30,900 words for Lubukusu words.

Visit

dataverse.harvard.edu

Tasks

part of speech tagging

Languages

BukusuDholuoLulogooli

Tags

lacuna fundfair forward

Licenses

CC0 1.0

Similar

AfriVoices-KE: A Multilingual Speech Dataset for Kenyan LanguagesBootstrapping Method for Developing Part-of-Speech Tagged Corpus in Low Resource Languages Tagset - A Focus on an African IgboPart of Speech Tagging for 18 African LanguagesUGSpeechData: A Multilingual Speech Dataset of Ghanaian Languages UGSpeechData: A Multilingual Speech Dataset of Ghanaian LanguagesKenPOSKenPOS

AfriVoices-KE: A Multilingual Speech Dataset for Kenyan Languages

AfriVoices-KE is a large-scale multilingual speech dataset comprising approximately 3,000 hours of a

Bootstrapping Method for Developing Part-of-Speech Tagged Corpus in Low Resource Languages Tagset - A Focus on an African Igbo

Most languages, especially in Africa, have fewer or no established part-of-speech (POS) tagged corpus. However, POS tagged corpus is essential for natural language processing (NLP) to support advanced researches such as machine translation, speech recognition, etc.

Part of Speech Tagging for 18 African Languages

Part of Speech tagging for 18 African Languages by Masakhane

UGSpeechData: A Multilingual Speech Dataset of Ghanaian Languages UGSpeechData: A Multilingual Speech Dataset of Ghanaian Languages

The UGSpeechData is a collection of audio speech data of Akan, Ewe, Dagaare, Dagbani, and Ikposo. Th

KenPOS

KenPOS is a part-of-speech (POS) tagged corpus for Kenyan languages, featuring 156,994 tokens across

KenPOS

KenPOS is a part-of-speech (POS) tagged corpus for Kenyan languages, featuring 156,994 tokens across