Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Toward robust representation for low-resource automatic speech recognition

Domaine:

natural language processing

Type de record:

paper
Créateur:
Sot
Éditeur:
Age
Hôte:
Vers une représentation robuste pour la reconnaissance automatique de la parole des langues peu dotées La parole humaine présente une grande variabilité en raison des différences physiologiques individuelles dans sa production. La plupart des caractéristiques acoustiques reposent sur des mesures de fréquence absolues et capturent intrinsèquement les informations relatives au locuteur, ce qui les rend dépendantes de celui-ci. Pour résoudre ces problèmes, les systèmes de reconnaissance automatique de la parole (ASR) nécessitent de nombreuses données d'entraînement annotées, qui sont souvent rares et coûteuses à obtenir, en particulier pour les langues peu dotées. Cette recherche vise à développer une représentation intrinsèque de la parole indépendante du genre du locuteur afin de réduire la quantité de données d'entraînement pour ASR. Notre première méthode intègre des caractéristiques dynamiques, inspirés par la dynamique de production et de perception de la parole, afin de caractériser la transition acoustique de la parole dans l'espace de fréquence centroïde de sous-bande spectrale (SSCF). Nous proposons d'utiliser des paramètres polaires pour capturer efficacement la transition sur le plan SSCF1-SSCF2. Ces caractéristiques dynamiques sont combinées aux coefficients cepstraux de fréquence Mel (MFCCs) conventionnels pour fournir une représentation plus riche. Pour renforcer la robustesse aux variations acoustiques, nous introduisons des caractéristiques de rapport polaire calculées sur le plan de rapport des SSCF étudiés. Pour traiter la parole tonale, nous proposons d'utiliser la SSCF0 comme caractéristique pseudo-F0. Notre étude indique que la méthode proposée améliore les performances de reconnaissance et renforce l'indépendance de genre du locuteur, spécifiquement pour le français.Comme la première méthode montre une généralisation limitée au khmer et au vietnamien, notre deuxième méthode vise à apprendre une représentation compacte de la parole qui capture principalement le contenu linguistique tout en minimisant les informations liées au locuteur. Nous proposons d'utiliser un autoencodeur à quantification vectorielle factorisée, ainsi que des tâches de supervision auxiliaires, afin de dissocier le parole en représentations de contenu, de locuteur et résiduelles. Notre étude montre que les représentations de contenu capturent efficacement les informations linguistiques détaillées, ce qui permet d'obtenir le parole intelligible. En reconnaissance de la parole, ces représentations surpassent significativement les caractéristiques de base et dynamiques, et présentent une plus grande robustesse au genre du locuteur en français, vietnamien et khmèr dans des scénarios peu dotées.

Visit

doi.org

Tasks

automatic speech recognitionspeech processing

Languages

BandiMénikNgemba

Similaires

Toward robust representation for low-resource automatic speech recognition Vers une représentation robuste pour la reconnaissance automatique de la parole des langues peu dotéesRobust speech recognition for low-resource languagesEnhancing Automatic Speech Recognition for Child Speech in Low-Resource LanguagesSpeech Representation System For The Karakalpak Automatic Speech RecognitionMultiple resolution analysis for robust automatic speech recognitionSMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition

Toward robust representation for low-resource automatic speech recognition Vers une représentation robuste pour la reconnaissance automatique de la parole des langues peu dotées

Human speech exhibits high variability due to individual physiological differences in

Robust speech recognition for low-resource languages

Process of human-machine interaction is an integral part of everyday human life in a modern world. T

Enhancing Automatic Speech Recognition for Child Speech in Low-Resource Languages

Automatic speech recognition (ASR) for children is demanding because their speech differs c

Speech Representation System For The Karakalpak Automatic Speech Recognition

Abstract Recently, automatic speech recognition (ASR) has moved from deeplearning

Multiple resolution analysis for robust automatic speech recognition

International audience This paper investigates the potential of exploiting the redund

SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition

Automatic Speech Recognition (ASR) models demonstrate outstanding performance on high-resource langu