Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

a3xrfgb/amharic-sentences-corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
a3x
Hôte:
This 1.6 million Amharic sentences corpus reflects current Amharic usage as of December 20, 2025, and is designed for anyone interested in: Training Amharic-based LLMs Fine-tuning NLP models Building search, summarization, or generative systems in Amharic The dataset is heavily cleaned and normalized, but like any serious LLM dataset, it still needs proper tokenization for pre-training.

Visit

huggingface.co

Tasks

language modeling

Languages

Amharic

Licenses

apache-2.0