Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Tigrinya Raw Pretraining Sources

Domain:

natural language processing

Record type:

dataset
Creator:
far
Host:
This repository contains raw files collected from publicly available Tigrinya datasets. These files are used as input sources for the Qal language model project: fanus.dev Important Note This is not a cleaned training corpus.

Visit

huggingface.co

Tasks

language modeling

Languages

Tigrigna

Tags

Tigrinyalow-resource-languagepretrainingqalsmall-language-models

Similar

Self-Repair in Tigrinya: Trouble Sources, Mechanisms and Solutionsneh7777/Pretraining-V1Amharic Pretraining CorpusSewasiw Tigrinya b'sefihu : A comprehensive Tigrinya grammar Comprehensive Tigrinya grammar Sewasiw Tigrinya bisefihuLyte/darija-pretraining-corpusChallengerSpaceShuttle/zulu-pretraining-dataset

Self-Repair in Tigrinya: Trouble Sources, Mechanisms and Solutions

This paper analyzes conversational self-repair, which refers to reconstructing problematic portions

neh7777/Pretraining-V1

A large-scale, unified collection of speech data for text-to-speech (TTS) and speech research. This

Amharic Pretraining Corpus

Amharic Pretraining Corpus is a large-scale dataset (~103M) for general amharic language pretraining

Sewasiw Tigrinya b'sefihu : A comprehensive Tigrinya grammar Comprehensive Tigrinya grammar Sewasiw Tigrinya bisefihu

Cover title

Lyte/darija-pretraining-corpus

ChallengerSpaceShuttle/zulu-pretraining-dataset

This is IsiZulu Pretraining Dataset. The dataset was used to pre-train BafoGPT-3B Books: Zulu-Englis