Logo Lanfrica

Feature Selection for Speaker Identification and Arabic Digits Recognition.(Dept.E) اختيار الميزة لتعريف المتحدث والتعرف على الأرقام العربية.(القسم هـ) Sélection de fonctionnalités pour l'identification du locuteur et la reconnaissance des chiffres arabes.(Dept.E) Selección de características para la identificación del orador y el reconocimiento de dígitos árabes.(Dept.E)

Domaine:

natural language processing

Type de record:

paper
Créateur:
MahAde
Éditeur:
Ope
Hôte:avatar
This article introduces a comparison between three different processing techniques for the selection of speech features. These features can be used for speaker recognition or speech recognition. A comparison between the performance of a system based on the linear prediction code, a system based on the cepstrum and a system based on the short time energy is introduced feature selection is very effective for recognition accuracy. This work illustrates where each of these features are more efficient for speaker recognition or for speech recognition. The results show that the short time  energy in time domain is very effective for epeech recognition where its accuracy is found to be 92%. In speaker identification, the accuracy of identification for the features depending on energy in each frame is found to be 60%. It may be recommended that the features based on the capstrum given accuracy of 94% and 96% for speech recognition and speaker identification respectively. The accuracy of linear prediction code features depend on cepstrum may be recommended for speaker identifier or speech recognition. A recognition system for spoken digits are given using the above features with neural networks. The neural network has been used as a tool in this comparison. تقدم هذه المقالة مقارنة بين ثلاث تقنيات معالجة مختلفة لاختيار ميزات الكلام. يمكن استخدام هذه الميزات للتعرف على المتحدث أو التعرف على الكلام. إن المقارنة بين أداء نظام يعتمد على رمز التنبؤ الخطي، ونظام يعتمد على cepstrum ونظام يعتمد على وقت قصير يتم تقديم اختيار ميزة فعالة للغاية من أجل دقة التعرف. يوضح هذا العمل أين تكون كل من هذه الميزات أكثر كفاءة للتعرف على المتحدث أو للتعرف على الكلام. تظهر النتائج أن الطاقة الزمنية القصيرة في المجال الزمني فعالة للغاية للتعرف على الكلام الإلكتروني حيث تم العثور على دقتها بنسبة 92 ٪. في تحديد مكبر الصوت، تم العثور على دقة تحديد الميزات اعتمادًا على الطاقة في كل إطار بنسبة 60 ٪. قد يوصى باستخدام الميزات المستندة إلى المنصة مع إعطاء دقة 94 ٪ و 96 ٪ للتعرف على الكلام والتعرف على المتحدث على التوالي. قد يوصى بدقة ميزات رمز التنبؤ الخطي التي تعتمد على cepstrum لمعرف مكبر الصوت أو التعرف على الكلام. يتم توفير نظام التعرف على الأرقام المنطوقة باستخدام الميزات المذكورة أعلاه مع الشبكات العصبية. تم استخدام الشبكة العصبية كأداة في هذه المقارنة. Cet article présente une comparaison entre trois techniques de traitement différentes pour la sélection des caractéristiques de la parole. Ces fonctionnalités peuvent être utilisées pour la reconnaissance du locuteur ou la reconnaissance vocale. Une comparaison entre les performances d'un système basé sur le code de prédiction linéaire, un système basé sur le cepstre et un système basé sur l'énergie de courte durée est introduite. La sélection de caractéristiques est très efficace pour la précision de la reconnaissance. Ce travail illustre où chacune de ces caractéristiques est plus efficace pour la reconnaissance du locuteur ou pour la reconnaissance vocale. Les résultats montrent que l'énergie de courte durée dans le domaine temporel est très efficace pour la reconnaissance vocale où sa précision est de 92 %. Dans l'identification du locuteur, la précision de l'identification des caractéristiques en fonction de l'énergie dans chaque trame est de 60 %. Il peut être recommandé que les caractéristiques basées sur le capstrum donnent une précision de 94 % et 96 % respectivement pour la reconnaissance vocale et l'identification du locuteur. La précision des caractéristiques du code de prédiction linéaire dépend du cepstre peut être recommandée pour l'identifiant du locuteur ou la reconnaissance vocale. Un système de reconnaissance pour les chiffres parlés est donné à l'aide des caractéristiques ci-dessus avec des réseaux neuronaux. Le réseau neuronal a été utilisé comme outil dans cette comparaison. Este artículo presenta una comparación entre tres técnicas de procesamiento diferentes para la selección de características del habla. Estas funciones se pueden utilizar para el reconocimiento de hablantes o el reconocimiento de voz. Una comparación entre el rendimiento de un sistema basado en el código de predicción lineal, un sistema basado en el cepstrum y un sistema basado en la energía de corto tiempo que se introduce, la selección de características es muy efectiva para la precisión del reconocimiento. Este trabajo ilustra dónde cada una de estas características es más eficiente para el reconocimiento de hablantes o para el reconocimiento de voz. Los resultados muestran que la energía de tiempo corto en el dominio del tiempo es muy efectiva para el reconocimiento de epeech donde se encuentra que su precisión es del 92%. En la identificación de altavoces, se encuentra que la precisión de la identificación de las características en función de la energía en cada fotograma es del 60%. Se puede recomendar que las características basadas en el capstrum tengan una precisión del 94% y 96% para el reconocimiento de voz y la identificación de hablantes, respectivamente. La precisión de las características del código de predicción lineal depende del cepstrum que se puede recomendar para el identificador del hablante o el reconocimiento de voz. Se proporciona un sistema de reconocimiento de dígitos hablados utilizando las características anteriores con redes neuronales. La red neuronal se ha utilizado como herramienta en esta comparación.

Languages

Licenses

Similaires