Logo Lanfrica

Regularized Urdu Speech Recognition with Semi-Supervised Deep Learning التعرف المنتظم على الكلام الأردية مع التعلم العميق شبه الخاضع للإشراف Reconnaissance de la parole en ourdou régularisée avec apprentissage en profondeur semi-supervisé Reconocimiento regular del habla en urdu con aprendizaje profundo semi-supervisado

Domaine:

natural language processing

Type de record:

paper
Créateur:
MohIbrSyeSoh
Éditeur:
Ope
Hôte:avatar
Automatic Speech Recognition, (ASR) has achieved the best results for English, with end-to-end neural network based supervised models. These supervised models need huge amounts of labeled speech data for good generalization, which can be quite a challenge to obtain for low-resource languages like Urdu. Most models proposed for Urdu ASR are based on Hidden Markov Models (HMMs). This paper proposes an end-to-end neural network model, for Urdu ASR, regularized with dropout, ensemble averaging and Maxout units. Dropout and ensembles are averaging techniques over multiple neural network models while Maxout are units in a neural network which adapt their activation functions. Due to limited labeled data, Semi Supervised Learning (SSL) techniques are also incorporated to improve model generalization. Speech features are transformed into a lower dimensional manifold using an unsupervised dimensionality-reduction technique called Locally Linear Embedding (LLE). Transformed data along with higher dimensional features is used to train neural networks. The proposed model also utilizes label propagation-based self-training of initially trained models and achieves a Word Error Rate (WER) of 4% less than that reported as the benchmark on the same Urdu corpus using HMM. The decrease in WER after incorporating SSL is more significant with an increased validation data size. حقق التعرف التلقائي على الكلام (ASR) أفضل النتائج للغة الإنجليزية، مع نماذج خاضعة للإشراف تعتمد على الشبكة العصبية الشاملة. تحتاج هذه النماذج الخاضعة للإشراف إلى كميات هائلة من بيانات الكلام المصنفة لتعميم جيد، والذي يمكن أن يكون تحديًا كبيرًا للحصول عليه للغات منخفضة الموارد مثل الأردية. تعتمد معظم النماذج المقترحة لـ ARDU ASR على نماذج ماركوف المخفية (HMMs). تقترح هذه الورقة نموذج شبكة عصبية من البداية إلى النهاية، للأردية ASR، مع تنظيم التسرب، ومتوسط المجموعة ووحدات Maxout. التسرب والفرق هي تقنيات متوسط على نماذج الشبكات العصبية المتعددة في حين أن Maxout هي وحدات في الشبكة العصبية التي تكيف وظائف التنشيط الخاصة بها. نظرًا لمحدودية البيانات المصنفة، يتم أيضًا دمج تقنيات التعلم شبه الخاضع للإشراف (SSL) لتحسين تعميم النموذج. يتم تحويل ميزات الكلام إلى مشعب منخفض الأبعاد باستخدام تقنية تقليل الأبعاد غير الخاضعة للإشراف تسمى التضمين الخطي المحلي (LLE). تُستخدم البيانات المتحولة جنبًا إلى جنب مع الميزات ذات الأبعاد الأعلى لتدريب الشبكات العصبية. يستخدم النموذج المقترح أيضًا التدريب الذاتي القائم على نشر الملصقات للنماذج المدربة في البداية ويحقق معدل خطأ في الكلمات (WER) أقل بنسبة 4 ٪ من ذلك المبلغ عنه كمعيار على نفس المجموعة الأردية باستخدام HMM. يعد الانخفاض في السجل الوبائي الأسبوعي بعد دمج طبقة المقابس الآمنة أكثر أهمية مع زيادة حجم بيانات التحقق من الصحة. La reconnaissance vocale automatique (ASR) a obtenu les meilleurs résultats pour l'anglais, avec des modèles supervisés basés sur un réseau neuronal de bout en bout. Ces modèles supervisés nécessitent d'énormes quantités de données vocales étiquetées pour une bonne généralisation, ce qui peut être assez difficile à obtenir pour les langues à faibles ressources comme l'ourdou. La plupart des modèles proposés pour l'Urdu ASR sont basés sur des modèles de Markov cachés (HMM). Cet article propose un modèle de réseau neuronal de bout en bout, pour Urdu ASR, régularisé avec des unités de décrochage, de moyennage d'ensemble et de Maxout. Le décrochage et les ensembles sont des techniques de calcul de moyenne sur plusieurs modèles de réseaux neuronaux tandis que Maxout sont des unités dans un réseau neuronal qui adaptent leurs fonctions d'activation. En raison des données étiquetées limitées, des techniques d'apprentissage semi supervisé (SSL) sont également incorporées pour améliorer la généralisation du modèle. Les caractéristiques vocales sont transformées en une variété dimensionnelle inférieure à l'aide d'une technique de réduction de dimensionnalité non supervisée appelée intégration linéaire locale (LLE). Les données transformées ainsi que les caractéristiques dimensionnelles supérieures sont utilisées pour former des réseaux neuronaux. Le modèle proposé utilise également l'auto-formation basée sur la propagation des étiquettes des modèles initialement formés et atteint un taux d'erreur de mot (Wer) de 4% inférieur à celui rapporté comme référence sur le même corpus ourdou en utilisant HMM. La diminution de Wer après l'intégration de SSL est plus significative avec une taille accrue des données de validation. El reconocimiento automático de voz (ASR) ha logrado los mejores resultados para el inglés, con modelos supervisados basados en redes neuronales de extremo a extremo. Estos modelos supervisados necesitan grandes cantidades de datos del habla etiquetados para una buena generalización, lo que puede ser todo un desafío para los idiomas de bajos recursos como el urdu. La mayoría de los modelos propuestos para el ASR en urdu se basan en modelos ocultos de Markov (HMM). Este documento propone un modelo de red neuronal de extremo a extremo, para ASR en urdu, regularizado con unidades de abandono, promediado de conjunto y Maxout. La deserción y los conjuntos son técnicas de promediado en múltiples modelos de redes neuronales, mientras que Maxout son unidades en una red neuronal que adaptan sus funciones de activación. Debido a los limitados datos etiquetados, también se incorporan técnicas de Aprendizaje Semi Supervisado (SSL) para mejorar la generalización de modelos. Las características del habla se transforman en una variedad de menor dimensión utilizando una técnica de reducción de dimensionalidad no supervisada llamada Incrustación Lineal Local (LLE). Los datos transformados junto con características de mayor dimensión se utilizan para entrenar redes neuronales. El modelo propuesto también utiliza la autoformación basada en la propagación de etiquetas de modelos inicialmente entrenados y logra una tasa de error de palabras (WER) del 4% menos que la informada como punto de referencia en el mismo corpus de urdu utilizando HMM. La disminución de WER después de incorporar SSL es más significativa con un mayor tamaño de los datos de validación.

Languages

Licenses

Similaires