Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Découverte d'unités linguistiques à l'aide de méthodes d'apprentissage non supervisé

Domain:

natural language processing

Record type:

paper
Creator:
Cél
Publisher:
Age
Host:
La découverte d'unités linguistiques élémentaires (phonèmes, mots) uniquement à partir d'enregistrements sonores est un problème non-résolu qui suscite un fort intérêt de la communauté du traitement automatique de la parole, comme en témoignent les nombreuses contributions récentes de l'état de l'art. Durant cette thèse, nous nous sommes concentrés sur l'utilisation de réseaux de neurones pour répondre au problème. Nous avons approché le problème en utilisant les réseaux de neurones de manière supervisée, faiblement supervisée et multilingue. Nous avons ainsi développé des outils de segmentation automatique en phonèmes et de classification phonétique fondés sur des réseaux de neurones convolutifs. L'outil de segmentation automatique a obtenu 79% de F-mesure sur le corpus de parole conversationnelle en anglais BUCKEYE. Ce résultat est similaire à un annotateur humain d'après l'accord inter-annotateurs fourni par les créateurs du corpus. De plus, il n'a pas besoin de beaucoup de données (environ une dizaine de minutes par locuteur et 5 locuteurs différents) pour être performant. De plus, il est portable à d'autres langues (notamment pour des langues peu dotées telle que le xitsonga). Le système de classification phonétique permet de fixer les différents paramètres et hyperparamètres utiles pour un scénario non supervisé. Dans le cadre non supervisé, les réseaux de neurones (Auto-Encodeurs) nous ont permis de générer de nouvelles représentations paramétriques, concentrant l'information de la trame d'entrée et ses trames voisines. Nous avons étudié leur utilité pour la compression audio à partir du signal brut, pour laquelle ils se sont montrés efficaces (faible taux de RMS, même avec une compression de 99%). Nous avons également réalisé une pré-étude novatrice sur une utilisation différente des réseaux de neurones, pour générer des vecteurs de paramètres non pas à partir des sorties des couches mais des valeurs des poids des couches. Ces paramètres visent à imiter les coefficients de prédiction linéaire (Linear Predictive Coefficients, LPC). Dans le contexte de la découverte non supervisée d'unités similaires à des phonèmes (dénommées pseudo-phones dans ce mémoire) et la génération de nouvelles représentations paramétriques phonétiquement discriminantes, nous avons couplé un réseau de neurones avec un outil de regroupement (k-means). L'alternance itérative de ces deux outils a permis la génération de paramètres phonétiquement discriminants pour un même locuteur : de faibles taux d'erreur ABx intra-locuteur de 7,3% pour l'anglais, 8,5% pour le français et 8,4% pour le mandarin ont été obtenus. Ces résultats permettent un gain absolu d'environ 4% par rapport à la baseline (paramètres classiques MFCC) et sont proches des meilleures approches actuelles (1% de plus que le vainqueur du Zero Ressource Speech Challenge 2017). Les résultats inter-locuteurs varient entre 12% et 15% suivant la langue, contre 21% à 25% pour les MFCC.

Visit

doi.org

Tasks

speech processing

Languages

Tsonga

Similar

Évaluation de la qualité des données géographiques d'OpenStreetMap à l'aide des méthodes d'apprentissage automatique : cas de la République de DjiboutiAssessing the quality of spatial data OpenStreetMap : case of the Republic of Djibouti Évaluation de la qualité des données géographiques d'OpenStreetMap à l'aide des méthodes d'apprentissage automatique : cas de la République de DjiboutiÀ la découverte des amhariquesExtraction de connaissances à partir de données textuelles : application à la découverte de règles de changement d'usage des solsLes attitudes linguistiques de quatre Peuls à ZiguinchorFouille de données à l'aide de modèles stochastiques : segmentation temporo-spatiale des successsions de cultures d'un territoire agricole à l'aide de HMM2

Évaluation de la qualité des données géographiques d'OpenStreetMap à l'aide des méthodes d'apprentissage automatique : cas de la République de Djibouti

La qualité des données de la base OpenStreetMap (OSM) peut être évaluée en comparant les données d'O

Assessing the quality of spatial data OpenStreetMap : case of the Republic of Djibouti Évaluation de la qualité des données géographiques d'OpenStreetMap à l'aide des méthodes d'apprentissage automatique : cas de la République de Djibouti

The quality of the OpenStreetMap (OSM) data can be assessed by comparing it with data

À la découverte des amhariques

En Éthiopie, l’amharique peut être qualifié de « langue des langues » tant son expansion fut liée au

Extraction de connaissances à partir de données textuelles : application à la découverte de règles de changement d'usage des sols

Source Agritrop Cirad (https://agritrop.cirad.fr/617135/) International audience This

Les attitudes linguistiques de quatre Peuls à Ziguinchor

Ce compte-rendu d'entretiens présente les déclarations et les prises de positions vis-à-vis du wolof

Fouille de données à l'aide de modèles stochastiques : segmentation temporo-spatiale des successsions de cultures d'un territoire agricole à l'aide de HMM2

National audience We propose an original data mining method to segment agricultural l