Read speech corpus for Amharic (አማርኛ) automatic speech recognition, converted to HuggingFace Datasets format from the original ALFFA project.
{
'audio': Audio(sampling_rate=16000),
'utterance_id': 'tr_10000_tr097082',
'transcript': 'ይህ አማርኛ ጽሑፍ ነው',
'speaker_id': '097',
'split': 'train'
}
from datasets import load_dataset
dataset = load_dataset("hadamard-2/alffa-amharic")