Audio-text dataset with 76 pairs of Twi (Ghanaian language) speech data.
audio/ - WAV audio files ({len(pairs)} files)
text/ - Corresponding text transcripts ({len(pairs)} files)
dataset_manifest.json - Links audio to text files
import json
from datasets import load_dataset, Audio
# Load manifest
with open("dataset_manifest.json") as f:
manifest = json.load(f)
# Create dataset from files
from datasets import Dataset