Logo Lanfrica

Toward robust representation for low-resource automatic speech recognition

Domain:

natural language processing

Record type:

paper
Creator:
Sot
Publisher:
Age
Host:
Vers une représentation robuste pour la reconnaissance automatique de la parole des langues peu dotées La parole humaine présente une grande variabilité en raison des différences physiologiques individuelles dans sa production. La plupart des caractéristiques acoustiques reposent sur des mesures de fréquence absolues et capturent intrinsèquement les informations relatives au locuteur, ce qui les rend dépendantes de celui-ci. Pour résoudre ces problèmes, les systèmes de reconnaissance automatique de la parole (ASR) nécessitent de nombreuses données d'entraînement annotées, qui sont souvent rares et coûteuses à obtenir, en particulier pour les langues peu dotées. Cette recherche vise à développer une représentation intrinsèque de la parole indépendante du genre du locuteur afin de réduire la quantité de données d'entraînement pour ASR. Notre première méthode intègre des caractéristiques dynamiques, inspirés par la dynamique de production et de perception de la parole, afin de caractériser la transition acoustique de la parole dans l'espace de fréquence centroïde de sous-bande spectrale (SSCF). Nous proposons d'utiliser des paramètres polaires pour capturer efficacement la transition sur le plan SSCF1-SSCF2. Ces caractéristiques dynamiques sont combinées aux coefficients cepstraux de fréquence Mel (MFCCs) conventionnels pour fournir une représentation plus riche. Pour renforcer la robustesse aux variations acoustiques, nous introduisons des caractéristiques de rapport polaire calculées sur le plan de rapport des SSCF étudiés. Pour traiter la parole tonale, nous proposons d'utiliser la SSCF0 comme caractéristique pseudo-F0. Notre étude indique que la méthode proposée améliore les performances de reconnaissance et renforce l'indépendance de genre du locuteur, spécifiquement pour le français.Comme la première méthode montre une généralisation limitée au khmer et au vietnamien, notre deuxième méthode vise à apprendre une représentation compacte de la parole qui capture principalement le contenu linguistique tout en minimisant les informations liées au locuteur. Nous proposons d'utiliser un autoencodeur à quantification vectorielle factorisée, ainsi que des tâches de supervision auxiliaires, afin de dissocier le parole en représentations de contenu, de locuteur et résiduelles. Notre étude montre que les représentations de contenu capturent efficacement les informations linguistiques détaillées, ce qui permet d'obtenir le parole intelligible. En reconnaissance de la parole, ces représentations surpassent significativement les caractéristiques de base et dynamiques, et présentent une plus grande robustesse au genre du locuteur en français, vietnamien et khmèr dans des scénarios peu dotées.