Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

"TRAD-MNSC Dataset : Traditional Multilingual Noisy Speech Corpus for Speech Enhancement Research."

Domaine:

natural language processing

Type de record:

dataset
Créateur:
SatShyNir
Éditeur:
IEE
Hôte:avatar
"The Traditional Multilingual Noisy Speech Corpus (TRAD-MNSC) is a comprehensive derived dataset specifically designed for evaluating traditional signal processing-based speech enhancement algorithms. This corpus comprises 5,600 audio files spanning seven Indian languages (Telugu, Tamil, Kannada, Malayalam, Bengali, Hindi, and Marathi) across four Signal-to-Noise Ratio (SNR) levels (5, 10, 15, and 20 dB), providing 2,800 clean-noisy speech pairs. The dataset was created by systematically mixing clean speech samples from the Kaggle dataset \u201cAudio Dataset with 10 Indian Languages\u201d with cafeteria environmentalnoise from the DEMAND database using precise SNR calibration. All audio files are sampled at 16 kHz with 16-bit resolution in mono channel format. This technical documentation presents the complete dataset structure, source attribution, mathematical formulations, noise characteristics analysis, quality control verification, and usage guidelines. The TRAD-MNSC dataset addresses the critical need for standardized, multilingual test corpora in speech processing research, particularly for traditional enhancement algorithms including spectral subtraction, Wiener filtering, Kalman filtering, and subspace methods."

Visit

doi.orgieee-dataport.org

Tasks

speech processing

Licenses

Creative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similaires

NCHLT Auxiliary Speech Corpus - MultilingualKARAKALPAK SPEECH CORPUS: THE FIRST BENCHMARK DATASET FOR AUTOMATIC SPEECH RECOGNITIONMcGill-NLP/NaijaS2ST | Multilingual Speech Dataset (Speech-to-Speech / Speech-to-Text Ready)Noise-Robust Multilingual Speech Recognition and the Tatar Speech CorpusCMU Wilderness Multilingual Speech DatasetAfriHate: Multilingual Hate Speech Dataset

NCHLT Auxiliary Speech Corpus - Multilingual

This is a combined multilingual version of the NCHLT Auxiliary Speech Corpus, compiled by the Data S

KARAKALPAK SPEECH CORPUS: THE FIRST BENCHMARK DATASET FOR AUTOMATIC SPEECH RECOGNITION

While large-scale pre-trained models have significantly advanced multilingual Automatic Speech Recog

McGill-NLP/NaijaS2ST | Multilingual Speech Dataset (Speech-to-Speech / Speech-to-Text Ready)

This dataset is a large-scale multilingual speech corpus curated for speech-to-speech translation, speech-to-text, and multilingual speech processing research. The data is organized by language, speaker (user_id), and dataset split (train, dev), and includes ric

Noise-Robust Multilingual Speech Recognition and the Tatar Speech Corpus

After focusing on individual languages for a long time, multilingual automatic speech recognition ha

CMU Wilderness Multilingual Speech Dataset

A dataset of over 700 different languages providing audio, aligned text and word pronunciations. On average each language provides around 20 hours of sentence-lengthed transcriptions. Data is mined from read New Testaments from http://www.bible.is/

AfriHate: Multilingual Hate Speech Dataset

Hate speech detection, NLP research Notes / challenges: Limited to 15 African languages