Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Synthèse de la parole arabe par apprentissage profond:Arabic speech synthesis using deep learning

Domaine:

natural language processing

Type de record:

paper
Créateur:
HadLac
Éditeur:
Eco
Hôte:avatar
Ce sujet de thèse vise à concevoir et à développer un système de synthèse de parole à partir du texte pour l’arabe standard, où les locuteurs virtuels proviennent de différentes régions du monde arabe. La synthèse de la parole arabe à partir du texte est un défi de taille, en raison des règles et des caractéristiques uniques de la langue arabe. En fait, bien que l’arabe standard, qui est la langue officielle de 22 pays, ait les mêmes règles linguistiques quelle que soit la région, sa prosodie dépend beaucoup de la zone géographique du locuteur arabophone. Par conséquent, ce projet de thèse a été proposé pour modéliser la prosodie de l’arabe standard d’une manière souple, de telle sorte que le système de synthèse vocale puisse être compatible avec le bon modèle de prosodie pour le bon locuteur. Pour ce faire, une étude des particularités phonologiques de l’arabe a eu lieu. L’accent a été mis sur deux phénomènes : la gémination et la diacritisation. En effet, les signes diacritiques et de gémination, qui sont des caractères spéciaux représentant respectivement les voyelles courtes et les doubles consonnes, ont un effet majeur sur la prononciation exacte de l’arabe. Cependant, ces signes ne sont souvent pas mentionnés dans le texte, car la plupart des lecteurs arabophones sont habitués à les deviner à partir du contexte. Pour résoudre ce problème, un système de conversion graphème-phonème pour l’arabe a été implémenté. Ce système fait partie d’un module de traitement de texte du système de synthèse de la parole (Text-to-Speech ou TTS) basé sur les réseaux de neurones profonds (Deep neural networks ou DNN). Dans le cas du texte arabe, cette étape commence par la prédiction des signes diacritiques et de gémination. Dans ce travail, cette étape a été entièrement réalisée sur la base de DNN. La conversion graphème-phonème du texte diacritisé a été réalisée en utilisant le code de Buckwalter. Par rapport aux approches de l’état de l’art, le système proposé donne un taux de précision plus élevé soit pour tous les phonèmes ou pour chaque classe, et une haute précision, un rejet et un score F1 pour chaque classe de signes diacritiques. La dernière partie de la thèse a été consacrée à l’étude des systèmes TTS utilisant la synthèse vocale par DNN (Merlin) et de la synthèse vocale de type end-to-end (Tacotron et Tacotron2) afin d’expliquer leur contribution et leurs avantages par rapport à la synthèse vocale par les modèles de Markov cachés (HMM). standard Arabic, where virtual speakers come from different Arabic regions. Synthesizing Arabic speech from text is always a daunting challenge, due to the unique rules and characteristics of the Arabic language. In fact, although standard Arabic, which is the official language of 22 countries, has the same linguistic rules whatever the region, its prosody varies remarkably according to the native region. Therefore, this thesis has been proposed to model the prosody of Arabic in a flexible way, so that the text-to-speech system can be compatible with the right prosody model of the right speaker, without any further/external settings regarding the dialect used or the nanative region. To do this, a study of the phonological peculiarities of Arabic was carried out. Emphasis was focused on two phenomena : geminating and diacritization. This is because diacritics and gemination signs, which are special characters representing short vowels and double consonants respectively, have a major effect on the exact pronunciation of Arabic. However, these signs are often not mentioned in the text, as most Arabic readers are used to guess them from the context. To solve this problem, a grapheme-to-phoneme conversion system for Arabic has been implemented, which is the natural language processing module of a DNN-based TTS system. In the case of the Arabic text, this step begins with the prediction of diacritics and gemination marks. In this work, this step was entirely carried out on the basis of Deep Neural Networks (DNN). The grapheme to phoneme conversion of the diacritized text was performed using Buckwalter’s code. Compared to state-of-the-art approaches, the proposed system gives a higher accuracy rate either for all phonemes or for each class, and high precision, recall and F1 score for each class of diacritics. A final part of the thesis was devoted to a study of TTS systems using synthesis by DNN (Merlin) and end-to-end speech synthesis (Tacotron and Tacotron2) in order to explain their additions and their advantages over that by HMM. p. 125-140

Visit

doi.orgwww.pist.tn

Tasks

diacritic restorationspeech processingtext normalizationtext to speech

Similaires

Parametric synthesis of Arabic speech Synthèse paramétrique de la parole ArabeSynthèse paramétrique de la parole ArabeDéveloppement d’un Système de Synthèse de la Parole Arabe par HMM:HTS-ARAB-TALKSpeech synthesis: (french) interjection "ouilleouilleouille" Synthèse de la parole: interjection "ouilleouilleouille"Présentation du système de synthèse de la parole à partir du texte arabe voyellé d'Elan SpeechAnalyse, annotation et étiquetage d’un corpus de parole arabe pour la synthèse vocale

Parametric synthesis of Arabic speech Synthèse paramétrique de la parole Arabe

The presented thesis deals with the adaptation of the conversion of a written text in

Synthèse paramétrique de la parole Arabe

Cette thèse porte sur l’adaptation de la synthèse paramétrique de la parole à partir d’un texte écri

Développement d’un Système de Synthèse de la Parole Arabe par HMM:HTS-ARAB-TALK

Cette thèse s’inscrit dans le cadre de la synthèse de la parole Arabe à partir du texte. Elle traite

Speech synthesis: (french) interjection "ouilleouilleouille" Synthèse de la parole: interjection "ouilleouilleouille"

caractéristiques du fichier wav:
mono
encodage: linéaire 16 bits signés (encoding: linea

Présentation du système de synthèse de la parole à partir du texte arabe voyellé d'Elan Speech

International audience no abstract

Analyse, annotation et étiquetage d’un corpus de parole arabe pour la synthèse vocale

Bibliographie : 2 p.