Soumission à Episciences
In this paper, we have focused our research on the state of the knowledge on speech processing and the research perspectives that exist in this domain. This research was conducted on several digital libraries such as IEEE Xplore, ScienceDirect, arXiv, Springer Link, Papers With Code etc. The research focused on the types of speech classification, the techniques used to extract speech features, the Machine Learning (ML) techniques used, and the speech data sources available. We found that studies focused mainly on emotion recognition, dialect identification in speech and speaker recognition. Mel Frequency Cepstral Coefficents (MFCC) is the main and most widely used for speech feature extraction. Neural networks dominate as ML techniques for speech classification. Speech databases available have been built in different contexts. Each database is specific to a given language, mainly English, German, Arabic, Chinese and French. There are almost no speech databases for low-resource languages, particularly african languages.
Dans cet article, nous avons axé nos recherches sur l'état des connaissances en matière de traitement de la parole et sur les perspectives de recherche qui existent dans ce domaine. Cette recherche a été menée sur plusieurs bibliothèques numériques telles que IEEE Xplore, ScienceDirect, arXiv, Springer Link, Papers With Code, etc. La recherche s'est concentrée sur les types de classification de la parole, les techniques utilisées pour extraire les caractéristiques de la parole, les techniques d'apprentissage automatique utilisées et les sources de données vocales disponibles. Nous avons constaté que les études se concentraient principalement sur la reconnaissance des émotions, l'identification des dialectes dans la parole et la reconnaissance du locuteur. Le MFCC (Mel Frequency Cepstral Coefficients) est la technique principale et la plus largement utilisée pour l'extraction des caractéristiques de la parole. Les réseaux neuronaux dominent en tant que techniques de ML pour la classification de la parole. Les bases de données vocales disponibles ont été construites dans différents contextes. Chaque base de données est spécifique à une langue donnée, principalement l'Anglais, l'Allemand, l'Arabe, le Chinois et le Français. Il n'existe pratiquement pas de bases de données vocales pour les langues peu dotées en particulier les langues africaines.