Logo Lanfrica

Développement d’un Système de Synthèse de la Parole Arabe par HMM:HTS-ARAB-TALK

Domaine:

natural language processing

Type de record:

paper
Créateur:
KriChe
Éditeur:
Fac
Hôte:avatar
Cette thèse s’inscrit dans le cadre de la synthèse de la parole Arabe à partir du texte. Elle traite plus précisément la procédure de création de la voix synthétique par les modèles de Markov cachés (HMM). Elle explique le développement d’un système de Text-To-Speech (TTS) en temps réel spécifiquement pour l’arabe. En effet, la Synthèse de la parole par des méthodes paramétriques a été largement développée au cours des dernières années suite au développement de la synthèse de la parole statistique par HMM. Cependant, la parole synthétisée résultante n’est pas aussi naturelle que la parole humaine. La flexibilité paramétrique reste limitée à reproduire les aspects de la qualité de la voix (mélodies et prosodie). L'hypothèse de ce travail est que la naturalité de la parole et la qualité de la voix peuvent être reproduite avec plus de précision par un synthétiseur de parole à base de HMM. Le système dédié pour la synthèse de la parole par HMM est nommé HTS (pour HMM Speech Synthesis System, qui a été réduit en HMM Triple S puis en HTS). Ce Système est développé par le laboratoire Nitech. Il repose sur une modélisation source/filtre pour représenter le signal parole. Ainsi, pour effectuer un apprentissage, HTS utilise un corpus de parole annoté dont le signal est paramétré afin d’obtenir les coefficients principaux de la parole. En plus de ces paramètres, chaque segment est qualifié en utilisant des labels qui sont utilisés pour sélectionner les modèles adéquats. Le système TTS développé dans ce travail est nommé HTS-ARAB-TALK. Pour ce là, nous avons développé une base de données arabe segmentée automatiquement en phonèmes et nommée PADAS. Ce système nous a permis d’établir un procédé très efficace de création de la parole de la langue Arabe que nous avons validé à travers l’évaluation subjective et objective de nombreuses voix. This thesis is part of the Arabic speech synthesis from Text-To-Speech. It deals specifically voice creation process synthesis HMM; in addition we develop a real-time TTS system specifically for the Arab. Synthesis of speech using the parametric method has received increased attention in recent years following the development of the synthesis of Statistics speech HMM. However, speech produced using this method still does not seem as natural as human speech and is limited parametric flexibility to replicate aspects of voice quality. The hypothesis of this thesis is that the naturalness of speech and voice quality can be reproduced more accurately by a HMM-based speech synthesizer. The reference system for speech synthesis HMM is called HTS (HMM for Speech Synthesis System, which was reduced HMM Triple S then HTS). This system developed by Nitech laboratory. The HTS system is based on a source modeling / filter to represent the speech signal. Thus, for a training step, HTS uses an annotated speech corpus whose signal is set to get the main coefficients of speech (F0, MGC). In addition to these parameters, each segment is described by using the labels. In the synthesis step, these labels used for selecting the appropriate model. Our system TTS developed in this work is called HTS-ARAB-TALK. To do this we develop an Arabic database phoneme automatically segmented named PADAS. Besides others files are needed. This system has allowed us to establish a very effective method of creating the word of Arabic language we validated through the subjective evaluation of many voices. p. 172-185