One-line summaryA small high-quality Swahili text corpus (≈58k documents, ~52.8 MB) extracted from Swahili Wikipedia and public news sources, cleaned, deduplicated, and split into train / validation / test. Suitable for fine-tuning and small-scale experiments.
Languages: Swahili (sw)
Total rows: ≈58,386
Size: ≈52.8 MB (parquet)
Splits: train (≈46.7k rows), validation (≈5.84k rows), test (≈5.84k rows)
Fields: