Kikuyu Transcription Dataset. 5 seconds to 11.6 seconds per Audio. ⭐️⭐️
# Kikuyu Transcription Dataset
## Dataset Summary
A collection of spoken Kikuyu utterances with transcriptions.
Each record:
`audio/ .wav|transcription|speaker_id`
## Files
- `kikuyu-dataset.xlsx` – original spreadsheet
- `metadata.txt` – pipe-delimited manifest
- `audio/` – 24 kHz, mono WAV files
## Dataset Card for HuggingFace Datasets
```yaml
name: kikuyu_transcription
version: 1.0.0
license: cc-by-4.0
task_categories: speech_recognition
languages: [ki]
homepage: BrianMwangi/kikuyu-transcri…
```
## Usage
```python
from datasets import load_dataset
ds = load_dataset("BrianMwangi/kikuyu-transcription-dataset", data_files="metadata.txt")
audio = ds["train"][0]["wav_filename"] # path in repo
text = ds["train"][0]["transcription"]
```
## Acknowledgments
This dataset is derived from resources provided by **OpenBible**. We thank them for their work and for making the data available under the CC BY 4.0 license.
open.bible