Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

demeleww/Amharic_tokens

Domaine:

natural language processing

Type de record:

dataset
Créateur:
dem
Hôte:
Pre-extracted HiggsAudioV2 audio tokens for training OmniVoice Amharic TTS. Downloading these tokens (~648 MB, ~2 min) skips the 30+ minute token extraction step (steps 1-3 of the training pipeline). Stat Value Total samples 81,731 Total audio ~331 hours Avg sample duration ~14.6 seconds Audio shards 164 (.tar files) Text shards 164 (.jsonl files) Samples per shard

Visit

huggingface.co

Tasks

speech processingtext to speech

Languages

Amharic

Tags

omnivoiceaudio-tokenspreprocessedttsamharicwebdataset

Licenses

apache-2.0