Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

dantesfai/TiDG-Corpus

Domaine:

natural language processing

Type de record:

dataset
Créateur:
dan
Hôte:
Tigrinya Multiclass Text Classification Dataset Across a diverse Genre # Tigrinya Diverse Genre Corpus (TiDG) for Text Categorization The Tigrinya Diverse Genre Corpus (TiDG) is a clean, labeled dataset designed for multiclass text classification in Tigrinya, a low-resource Semitic language widely spoken in Eritrea and northern Ethiopia. The corpus comprises 8,067 text documents, covering seven diverse categories: Culture, Economy, Health, Politics, Religion, Science & Technology, and Sport. Each document is provided in both its cleaned Tigrinya script form and a SERA transliteration, supporting researchers who may prefer working with either script. The dataset is preprocessed, stratified, and split into training (80%), validation (10%), and testing (10%) subsets, ensuring robust evaluation of machine learning models. This dataset addresses the scarcity of benchmark corpora for Tigrinya and contributes to advancing research in natural language processing (NLP) for low-resource languages. Potential applications include document categorization, content recommendation, intent recognition, and domain-specific information retrieval. A label encoder is included to facilitate mapping between category names and numeric labels. The dataset is distributed in CSV format, accompanied by usage scripts and documentation. TiDG provides an essential resource for researchers aiming to build, evaluate, and benchmark text classification models for underrepresented languages, promoting inclusivity in multilingual NLP research. ## Dataset Description - **Language**: Tigrinya (with transliteration using the SERA standard) - **Total Samples**: 8,067 text documents - **Split**: - Train: 80% (6,453 samples) - Validation: 10% (807 samples) - Test: 10% (807 samples) - **Format**: CSV files (`train.csv`, `val.csv`, `test.csv`) - **Columns**: - `cleaned_text`: Preprocessed and normalized Tigrinya text - `transliteration`: SERA transliteration of the cleaned text - `label`: Numeric label corresponding to one of the categories ## Categories The dataset includes …

Visit

github.com

Tasks

topic classificationtext classification

Languages

Tigrigna

Licenses

MIT

Similaires

"Tigrinya Diverse Genre Corpus (TiDG) for Text Categorization"dantesfai/tig_stopwordsdantesfai/Tigrinya_Multiclass_Text_Classificationdantesfai/tigrinya-normalizer

"Tigrinya Diverse Genre Corpus (TiDG) for Text Categorization"

"The Tigrinya Diverse Genre Corpus (TiDG) constitutes a labeled multiclass Tigrinya corpus for the l

dantesfai/tig_stopwords

Stopwords Generator for Tigrinya # Stopwords Generator for Tigrinya ## Purpose **Stopword Generat

dantesfai/Tigrinya_Multiclass_Text_Classification

# Tigrinya Multiclass Text Classification Experiment (Reproducible Research) This repository contai

dantesfai/tigrinya-normalizer

# Tigrinya Normalizer A Python package and command-line tool for normalizing Tigrinya text. It appl