# Setswana Voice Pipeline
A complete pipeline for scraping, processing audio, transcribing, and compiling Setswana voice datasets.
## Project Structure
This repository is structured as follows:
- **`scraper/`**: Pulls written text from sources such as BOPA and Daily News.
- **`audio/`**: Contains scripts to process raw audio files.
- **`transcription/`**: Houses the transcription and correction web application.
- **`datasets/`**: Stores manifest files, metadata, and dataset configurations.