Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Automatic speech recognition for less-represented languages Transcription automatique de langues peu dotées

Domain:

natural language processing

Record type:

paper
Creator:
Pel
Editor:
LabUniLor
Publisher:
CCSD
Host:avatar
With the development of technologies operating in a multilingual context, portability of speech technologies, and in particular, speech recognition, is a key challenge. State-of-the-Art speech recognizers are typically trained on very large amounts of data, both transcribed speech and texts. Recently there is a growing interest in developing speech technologies for languages for which only small amounts of data, and little or no linguistic expertise are accessible. For such languages, high Out-Of-Vocabulary (OOV) rates, poor language model estimation, are major issues. After studying the impact on recognition performance for the different types of training data : speech material used to train acoustic models ; texts corresponding to the transcriptions of the speech corpus ; and texts collected from newspapers and newswires available on the Web, automatic word decompounding to reduce OOV rates was investigated, with application to two case of studies : Amharic, the official language of Ethiopia and Turkish. A baseline algorithm was enhanced in order to address the problem of increased phonetic confusability arising from word decompounding, by incorporating phonetic properties and some constraints on recognition units derived from prior forced alignment experiments. OOV rates were reduced by 30% to 50% and relative word error rate reductions up to 5% were achieved. The algorithm is relatively language independent and requires minimal adaptation to be applied to other languages Les technologies liées à la parole, et en particulier la reconnaissance de la parole, suscitent un grand intérêt pour un nombre croissant de langues. La très grande majorité des langues du monde ne possèdent pas de grands corpus de données nécessaires à l'élaboration des systèmes de reconnaissance à l'état de l'art, fondés sur des paradigmes probabilistes pour la plupart. Les travaux menés au cours de cette thèse ont consisté, dans un premier temps, à identifier les difficultés rencontrées lors de l'élaboration d'un système pour une langue peu dotée. Nous avons travaillé principalement sur le problème des forts taux de mots hors-vocabulaire dus au manque de textes, qui est à nos yeux le problème le plus important pour ces langues. Nous défendons l'idée que l'utilisation de sous-unités lexicales correctement sélectionnées qui peuvent être plus petites que les mots, peut amener des gains significatifs de performances. Nous avons utilisé et modifié un algorithme probabiliste qui propose des frontières de morphe, en introduisant des propriétés qui caractérisent la confusion acoustico-phonétique éventuelle entre les unités lexicales de reconnaissance. Les expériences de reconnaissance ont été menées sur deux langues différentes : l'amharique et le turc, et des gains modestes mais significatifs ont été obtenus, autour de 5% relatifs, avec des réductions relatives de taux d'OOV comprises entre 30% et 50%.

Visit

theses.hal.science

Tasks

automatic speech recognitionspeech processing

Languages

Amharic

Tags

automatic speech recognitionless-represented languageslexical modelingmorphologytranscription automatique de la parolelangues peu dotéesmodélisation lexicalemorphologie[INFO]Computer Science [cs]

Licenses

https://about.hal.science/hal-authorisation-v1/info:eu-repo/semantics/OpenAccess

Similar

Toward robust representation for low-resource automatic speech recognition Vers une représentation robuste pour la reconnaissance automatique de la parole des langues peu dotéesGénérateur de dictionnaires au format Android pour les langues peu dotéesLe Machine Learning : numérique non supervisé et symbolique peu supervisé, une chance pour l’analyse sémantique automatique des langues peu dotéesManipulation de dictionnaires d'origines diverses pour des langues peu dotées : la méthodologie iBaatukaayÉtiquetage en parties du discours de langues peu dotées par spécialisation des plongements lexicauxProduire des ressources électroniques à partir de descriptions formelles : application aux langues peu dotées

Toward robust representation for low-resource automatic speech recognition Vers une représentation robuste pour la reconnaissance automatique de la parole des langues peu dotées

Human speech exhibits high variability due to individual physiological differences in

Générateur de dictionnaires au format Android pour les langues peu dotées

Nous présentons un outil informatique en source libre permettant, à partir d’un dicti

Le Machine Learning : numérique non supervisé et symbolique peu supervisé, une chance pour l’analyse sémantique automatique des langues peu dotées

International audience Les données non structurées dominent l'univers de la productio

Manipulation de dictionnaires d'origines diverses pour des langues peu dotées : la méthodologie iBaatukaay

International audience Generally, African languages are less-resourced languages. Mos

Étiquetage en parties du discours de langues peu dotées par spécialisation des plongements lexicaux

Cet article présente une nouvelle méthode d'étiquetage en parties du discours adaptée

Produire des ressources électroniques à partir de descriptions formelles : application aux langues peu dotées

National audience Dans cet article, nous montrons comment les langages de description