Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Somali-English Parallel Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
maa
Hôte:
This dataset contains high-quality parallel sentence pairs, multi-sentence alignments, and paragraph-level translations between Somali and English. It is specifically curated and structured to train, fine-tune, and evaluate machine translation models and large language models (LLMs) for Somali-English language tasks. Language Pair: Somali (so) <-> English (en) Format: JSON Lines (.jsonl)

Visit

huggingface.co

Tasks

machine translation

Languages

Somali

Tags

somalienglishtranslationparallel-corpus

Licenses

mit

Similaires

Akan–English Maternal Health Parallel Corpus Akan–English Maternal Health Parallel CorpusNupe-English parallel corpusAmharic-English Parallel Corpusluganda-english-parallel-corpusEnglish Hausa Parallel Corpuskambale/luganda-english-parallel-corpus

Akan–English Maternal Health Parallel Corpus Akan–English Maternal Health Parallel Corpus

This dataset contains a curated bilingual parallel corpus developed to support domain-specific neura

Nupe-English parallel corpus

This is the first ever Nupe - English Parallel Corpus and Nupe Monolingual Corpora curated from diverse sources including poems,idioms, proverbs, religpoius text etc. The aim of this data collection is to make available a cultural-aware Nupe-english corpus for NLP

Amharic-English Parallel Corpus

This corpus consists of 145,820 Amharic-English parallel sentences (segments) from various sources. This corpus is larger in size than previously compiled corpora. It is released for research purposes and can be used to train or support Amharic-English machine tran

luganda-english-parallel-corpus

English Hausa Parallel Corpus

This English–Hausa Parallel Corpus is a curated bilingual dataset of 5,000 aligned sentence pairs, t

kambale/luganda-english-parallel-corpus

This dataset contains parallel sentences in English (en) and Luganda (lg), designed primarily for tr