Logo Lanfrica

Brian-Mwangi-developer/KIKUYU_DATASET

Domain:

natural language processing

Record type:

dataset
Creator:
Bri
Host:
Kikuyu Transcription Dataset. 5 seconds to 11.6 seconds per Audio. ⭐️⭐️ # Kikuyu Transcription Dataset ## Dataset Summary A collection of spoken Kikuyu utterances with transcriptions. Each record: `audio/ .wav|transcription|speaker_id` ## Files - `kikuyu-dataset.xlsx` – original spreadsheet - `metadata.txt` – pipe-delimited manifest - `audio/` – 24 kHz, mono WAV files ## Dataset Card for HuggingFace Datasets ```yaml name: kikuyu_transcription version: 1.0.0 license: cc-by-4.0 task_categories: speech_recognition languages: [ki] homepage: BrianMwangi/kikuyu-transcri… ``` ## Usage ```python from datasets import load_dataset ds = load_dataset("BrianMwangi/kikuyu-transcription-dataset", data_files="metadata.txt") audio = ds["train"][0]["wav_filename"] # path in repo text = ds["train"][0]["transcription"] ``` ## Acknowledgments This dataset is derived from resources provided by **OpenBible**. We thank them for their work and for making the data available under the CC BY 4.0 license. open.bible