This is a merged parallel corpus for English-Hausa machine translation, created from multiple publicly available datasets. The dataset has been filtered for quality using Quality Estimation (QE) scores and deduplicated to ensure high-quality training data.
Updated: 2025-09-21
Language Pair: English (en) to Hausa (ha)
Total Samples After Deduplication: 156,679
Total Samples Before Deduplication: 223,173