Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

mewaeltsegay/TigrinyaLargeText

Domain:

natural language processing

Record type:

dataset
Creator:
mew
Host:
TIgrinyaLargeTextDataset is a large-scale collection of Tigrinya language articles designed for training Large Language Models (LLMs) and other Natural Language Processing (NLP) tasks. This dataset addresses the critical need for high-quality Tigrinya language resources in the machine learning community. Language: Tigrinya Task Categories: Language Modeling, Text Generation, NLP Research

Visit

huggingface.co

Tasks

language modeling

Languages

Tigrigna

Tags

tigrinyatigrigna

Licenses

mit

Similar

mewaeltsegay/tigrinya_text_preprocessingmewaeltsegay/Tigrinya_QA_trainingmewaeltsegay/tokenizermewaeltsegay/Tigrinya-BPE-Tokenizermewaeltsegay/Tigrinya-SentencePiece-Tokenizermewaeltsegay/Tigrinya-WordLevel-Tokenizer

mewaeltsegay/tigrinya_text_preprocessing

A pipeline for cleaning Tigrinya text. # Haddas Eritra Preprocessing Pipeline A comprehensive text

mewaeltsegay/Tigrinya_QA_training

All the different experiments done to train a dedicated QA model for Tigrinya. # Desta 1B QA Fine-t

mewaeltsegay/tokenizer

Tigrinya Language Tokenizers # Tigrinya Multi-Type Tokenizers for LLM Training A comprehensive col

mewaeltsegay/Tigrinya-BPE-Tokenizer

mewaeltsegay/Tigrinya-SentencePiece-Tokenizer

mewaeltsegay/Tigrinya-WordLevel-Tokenizer