A toolkit for preprocessing and organizing speech datasets for ASR, TTS, and voice AI projects.
# ASR Data Pipeline for Hausa Language
This project provides a modular data preprocessing pipeline designed for Automatic Speech Recognition (ASR) tasks, specifically for Hausa language audio datasets. It prepares audio data and corresponding transcripts into a format suitable for training speech recognition models.
## Features
- 🔊 Audio normalization and resampling
- 📜 Transcript preparation and alignment
- 📁 Dataset organization for ASR model training
- 🗣️ Supports Hausa language datasets
## Folder Structure