Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

biblenlp-corpus

Type de record:

dataset
Créateur:
tim
Hôte:
Partial and complete Bible translations in 833 languages, aligned by verse. Languages

Visit

huggingface.co

Tasks

machine translation

Languages

AkanAkooseAmoBaatonumBaga SitemuBangwinjiBedjondBisãBokoBokobaru+95

Licenses

cc-by-4.0other

Similaires

DziriOFN Corpus (Dziri Offensive corpus) v1.0AAAC-Corpus/AAAC-Algerian-Arabic-Adversarial-CorpusBVLAC corpus - Extracted Data Corpus BVLAC - Données extraitesAfroMAFT Corpus: Language Adaptation Corpus for African languagesThe SAWA Corpus: a Parallel Corpus English - SwahiliSwahili Corpus

DziriOFN Corpus (Dziri Offensive corpus) v1.0

Dziri refers to the name of the Algerian dialectal Arabic. DziriOFN is a new corpus dedicated to offensive language detection on this under-resourced language. Dziri dialect if known as a complex socio-linguistic situation, where the latter is known by the code-

AAAC-Corpus/AAAC-Algerian-Arabic-Adversarial-Corpus

Dataset and code for AAAC: Algerian Arabic Adversarial Corpus for dialect-aware hate speech and prom

BVLAC corpus - Extracted Data Corpus BVLAC - Données extraites

[FR] Dans le cadre du projet SONGES sur la mise en correspondance de données textuelles massives et

AfroMAFT Corpus: Language Adaptation Corpus for African languages

Language Adaptation Corpus for 17 African languages, English, French, and Arabic.

The SAWA Corpus: a Parallel Corpus English - Swahili

Research in data-driven methods for Machine Translation has greatly benefited from the increasing availability of parallel corpora. Processing the same text in two different languages yields useful information on how words and phrases are translated from a source l

Swahili Corpus

This is a Swahili corpus obtained from CC-100: Monolingual Datasets from Web Crawl Data