Political Misinformation Classification Datasets
# PolitiKweli
PolitiKweli is a Swahili-English code-switched misinformation classification dataset
# Dataset
The dataset is available via DOI: 10.5281/zenodo.10228602. It contains:
1. *6,345 Swahili-English* annotated code-switched texts
2. *22,954 English annotated texts*
3. *211 Swahili* annotated texts.
# Papers
1. Publication papers from Deep Learning Indaba Conference, 2023. Link:
openreview.net
2. Proceedings from Second International Conference on Speech & Language Technology for Low-resource Languages (SPELLL), 2023. Link:
link.springer.com
# Cite
Amol, C., Wanzare, L., Obuhuma, J. (2024). PolitiKweli: A Swahili-English Code-Switched Twitter Political Misinformation Classification Dataset. In: Chakravarthi, B.R., et al. Speech and Language Technologies for Low-Resource Languages. SPELLL 2023. Communications in Computer and Information Science, vol 2046. Springer, Cham.
doi.org
# References
The dataset is available for research and other academic related work.
If you need access, kindly contact Cynthia Amol via cjayneamol028@gmail.com or cynthia@maseno.ac.ke