Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Pristine Twi-English Parallel Dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
gha
Hôte:
A large-scale Twi ↔ English parallel dataset derived from the Pristine Twi Dataset by the Ghana NLP Community. The Twi source texts span four distinct styles — Monologue, Narrative, Dialogue, and Storyful — grounded in real Ghanaian news topics to capture authentic vocabulary and named entities. Each Twi passage has been translated into fluent English using a batch translation pipeline powered by the Gemini API.

Visit

huggingface.co

Tasks

machine translation

Languages

AkanBwamu, CwiDinka, SoutheasternTwi

Tags

twiakanghanaafricanlptranslationparallel-corpus

Licenses

cc-by-4.0

Similaires

Pristine Twi-English Parallel Datasetghananlpcommunity/pristine-twi-english-parallel-sentencesTwi-English Parallel DatasetTwi-English Parallel TextENGLISH-AKUAPEM TWI PARALLEL CORPUS

Pristine Twi-English Parallel Dataset

A large-scale Twi ↔ English parallel dataset derived from the Pristine Twi Dataset by the Ghana NLP

ghananlpcommunity/pristine-twi-english-parallel-sentences

A massive, sentence-level, deduplicated Twi ↔ English parallel dataset optimized specifically for tr

Twi-English Parallel Dataset

This dataset contains a large-scale parallel corpus of Twi-English sentence pairs, featuring synthet

Twi-English Parallel Text

A parallel corpus of Asante Twi and English sentence pairs compiled by Ghana NLP Community. Source

ENGLISH-AKUAPEM TWI PARALLEL CORPUS

This dataset (verified_data.csv) is bilingual machine translation training corpus for English and Akuapem Twi of 25,421 sentence pairs. 
A transformer-based machine translator was u