Kongoo ya Kiswahili v1 — Kiswahili CPT corpus from BAKITA (Baraza la Kiswahili la Taifa).
from datasets import load_dataset
ds = load_dataset("bakita/bakita-kongoo-v1", split="train")
Field
Description
text
Kiswahili text chunk
source_file
Anonymized source document identifier
doc_type
Document category
language
Language code (sw)
chunk_id
Chunk index within the source file
task