Logo Lanfrica

Methods for speech recognition under low resource conditions Modélisations pour la reconnaissance de la parole à données contraintes

Domaine:

natural language processing

Type de record:

paper
Créateur:
Lam
Éditeur:
LabVocSciUni
Éditeur:
CCSD
Hôte:avatar
This thesis explores the development of speech recognition systems in the context of low-resource conditions. Over the last decade, advances with deep neural networks have led to large improvements in the performance of speech-to-text systems. The success of deep learning methods relies on supervised training with very large annotated corpora, typically comprised of thousands of hours of recordings with manual transcriptions, and on increasing the number of trainable parameters in the models. However, sufficient training corpora are not always available due to the lengthy and costly process of data collection and annotation. Our aim is to build systems under low-resource conditions (a few hours) for the transcription of conversational speech. Recent research shows that state-of-the-art hybrid systems with distinct acoustic and linguistic models are more efficient than neuronal end-to-end systems when less than ten hours of annotated speech are available. Therefore, we adopt hybrid models, and investigate multilingual acoustic modeling to mutualize linguistic resources from multiple sources. For the multilingual models, we first investigate the impact of the amount of training data as well the similarity between the training and target languages. The multilingual models are evaluation both without adaptation and after fine-tuning via transfer learning on conversational telephone speech data in four languages (Amharic, Assamese, Georgian, and Kurmandji) collected as part of the iARPA Babel program. These languages are linguistically varied and were chosen to cover several language families. Next, we study language adaptive training in which the acoustic feature vector is augmented with a language embedding when training the multilingual acoustic model. Our multilingual models can be used to decode speech or to extract multilingual features. These features are evaluated on both the Babal corpus and on the South African corpus Soap Operas, composed of code-switched speech. We compare our hybrid models with multilingual self-supervised publicly available pretrained models, trained with a large amount of data from various domains. For every proposed method and for all target languages, we show that hybrid multilingual systems remain competitive and robust under low resource conditions, while having the advantage of being industrializable with low computational resource requirements. Lastly, we show the usefulness of multilingual acoustic modeling on keyword spotting when only a few hours of monolingual data are available. Cette thèse s'inscrit dans le cadre du développement de systèmes de reconnaissance de la parole à données contraintes. Depuis une dizaine d'années, les réseaux de neurones profonds ont permis d'améliorer grandement la performance des systèmes de reconnaissance de la parole. Le succès de l'apprentissage profond va de pair avec l'utilisation de milliers d'heures de parole transcrite manuellement et avec l'augmentation du nombre de paramètres des modèles. Cependant, la constitution de corpus de parole annotée est le résultat d'un processus long et coûteux ce qui limite les quantités disponibles pour certaines conditions. Pour cette raison, nous nous intéressons au développement de systèmes avec très peu de données (quelques heures), en particulier pour traiter la parole conversationnelle. Les travaux actuels à l'état de l'art montrent qu'en dessous de quelques dizaines d'heures de données d'apprentissage de parole, les systèmes hybrides avec modélisation acoustique et linguistique séparées sont plus efficaces que les systèmes neuronaux de bout-en-bout. Nous privilégions donc ces approches en nous intéressant en particulier à la modélisation acoustique multilingue avec la mutualisation de données issues de sources différentes. Pour les modèles multilingues, nous analysons la répartition des données à adopter entre différentes sources selon la proximité des langues d'apprentissage et des langues cibles. De plus, nous évaluons l'utilisation directe des modèles acoustiques multilingues sans adaptation et une adaptation par transfert de connaissance vers une nouvelle langue sur quatre langues cibles (amharique, assamais, géorgien et kurmandji) du programme iARPA Babel. Ces langues présentent des caractéristiques linguistiques différentes et choisies pour couvrir plusieurs familles de langue. Un apprentissage adaptatif est aussi proposé par le biais de l'ajout d'une représentation vectorielle de la langue dans le modèle acoustique. Nous utilisons les différents modèles multilingues obtenus pour décoder la parole ou pour extraire dse paramètres acoustiques multilingues. Cette dernière approche est également évaluée sur le corpus sud-africain Soap Operas, comportant de l'alternance codique. Ensuite, nous comparons nos modèles hybrides et des modèles multilingues pré-entraînés par auto-supervision sur des corpus de très grande taille et provenant de domaines variés. Quelle que soit la méthode d'apprentissage et la langue de test, nous montrons que les systèmes hybrides multilingues restent compétitifs et robustes pour les données sous contraintes et qu'ils présentent l'avantage d'être industrialisables, car plus légers et plus facilement embarquables. Enfin, nous montrons l'apport de la modélisation acoustique multilingue sur une tâche de détection de mots-clés lorsque peu de données monolingues sont disponibles.

Similaires