This dataset is a processed version of the original BDU-speech dataset by Yohannes A. Ejigu.
It contains paired Amharic speech audio and transcriptions, structured for use in automatic speech recognition (ASR) research and model training.
Audio files are decoded as mono. Sampling rates may vary across files.
DatasetDict({
train: Dataset({
features: ['audio', 'sentence'],