This dataset contains Moroccan Darija speech recordings and their corresponding transcriptions, intended for fine-tuning text-to-speech models.
wavs_16k/: Directory containing 16kHz mono 16-bit WAV audio files.
metadata_train.csv: CSV file with training data.
metadata_val.csv: CSV file with validation data.
Load the dataset using:
from datasets import load_dataset