Logo Lanfrica

Speech processing in computer science: a review of feature extractors, approaches, Machine Learning and Deep Learning techniques Le traitement de la parole en informatique : une synthèse des extracteurs de caractéristiques, des approches et des techniques d'apprentissage automatique et d'apprentissage profond

Domaine:

natural language processing

Type de record:

paper
Créateur:
SOMTra
Éditeur:
Uni
Éditeur:
CCSD
Hôte:avatar
Soumission à Episciences A lot of research has been carried out on speech analysis since the 1970s. In this study, we focus on the current state of knowledge on audio feature extraction techniques, the machine learning and deep learning techniques used in this field, as well as the approaches and types of databases that can be used. This research was conducted on several digital libraries such as IEEE Xplore, ScienceDirect, arXiv, Springer Link, Papers with Code etc. We found that studies focused mainly on emotion recognition, dialect identification in speech and speaker recognition. Mel Frequency Cepstral Coefficients (MFCC) is the main and most widely used for speech feature extraction. Neural networks dominate as ML techniques for speech classification. Speech databases available have been built in different contexts. Each database is specific to a language, mainly English, German, Arabic, Chinese and French. There are almost no speech databases for low-resource languages, particularly African languages. De nombreuses recherches ont été menées sur l’analyse de la parole depuis les années 1970. Dans cette étude, nous nous concentrons sur l’état actuel des connaissances concernant les techniques d’extraction de caractéristiques audio, les techniques d’apprentissage automatique et d’apprentissage profond utilisées dans ce domaine, ainsi que les approches et les types de bases de données pouvant être utilisés. Cette recherche a été menée à partir de plusieurs bibliothèques numériques telles que IEEE Xplore, ScienceDirect, arXiv, Springer Link, Papers with Code, etc. Nous avons constaté que les études existants portaient principalement sur la reconnaissance des émotions, l’identification des dialectes dans la parole et la reconnaissance des locuteurs. Les coefficients cepstraux de fréquence mélique (MFCC) constituent la principale méthode, et la plus largement utilisée, pour l’extraction des caractéristiques de la parole. Les réseaux neuronaux dominent parmi les techniques d’apprentissage automatique utilisées pour la classification de la parole. Les bases de données vocales disponibles ont été constituées dans des contextes variés. Chaque base de données est spécifique à une langue, principalement l’anglais, l’allemand, l’arabe, le chinois et le français. Il n’existe pratiquement aucune base de données vocale pour les langues disposant de peu de ressources, en particulier les langues africaines.

Similaires