Logo Lanfrica

Narrow Convolutional Neural Network for Arabic Dialects Polarity Classification الشبكة العصبية الالتفافية الضيقة لتصنيف قطبية اللهجات العربية Réseau neuronal convolutif étroit pour les dialectes arabes Classification de la polarité Red neuronal convolucional estrecha para la clasificación de polaridad de los dialectos árabes

Domain:

natural language processing

Record type:

paper
Creator:
MuaNurMasHaz
Publisher:
Ope
Host:avatar
The complexities and tangles of Arabic dialect in orthography and morphology typically make the sentimental analysis quite challenging.Moreover, most of the classification approaches have addressed this problem based on hand-crafted features.Since the Arabic language has multi-dialects and the language has no word-based order, the extraction process and the classification tasks are more difficult and time consuming.Deep neural network approaches applied to the Arabic language colloquial are very limited.These deep learning approaches typically comprise a structure that is very complex for small quantities of data.The structures are based on wide convolutional networks that are not capable of capturing the entire semantic and sentiment features for Arabic dialects.In this paper, a narrow structure of the convolutional neural network (CNN) has been proposed in order to obtain the tweets representations and classify the Arabic tweets into five, three and two polarities.Sensitivity analysis has been conducted to evaluate the impact of various combination structural properties, such as the number of convolutional filters, pooling size, and filter size on the classification performances.The proposed Arabic narrow convolutional neural network (NCNN) has captured the entire semantic and sentiment information contained in the tweet by maximizing the features of the detector's range.The NCNN performances were estimated to be at its optimum when structured by three convolutional layers, each one followed by the max pooling layer.The model has been developed without using lexicon resources and lexical features or augmented the dataset with extra training data.The narrow model is the first baseline model for Arabic dialects sentiment classifications for a sentence level as it is the first narrow CNN model addressing the Arabic Dialect tweets.NCNN model achieved the lowest macro average mean absolute error (MAE M ) for five polarity and higher Macro average recall (P) for three and two polarities on the SemEval-2017 Arabic dialect Twitter datasets when compared to the other state-of-the-art approaches. عادة ما تجعل تعقيدات وتشابك اللهجة العربية في الإملاء والصرف التحليل العاطفي صعبًا للغاية. علاوة على ذلك، عالجت معظم مناهج التصنيف هذه المشكلة بناءً على ميزات مصنوعة يدويًا. نظرًا لأن اللغة العربية لها لهجات متعددة واللغة ليس لها ترتيب قائم على الكلمات، فإن عملية الاستخراج ومهام التصنيف أكثر صعوبة وتستغرق وقتًا طويلاً. تعد مناهج الشبكة العصبية العميقة المطبقة على اللغة العربية العامية محدودة للغاية. هذه العميقة عادة ما تتكون مناهج التعلم من بنية معقدة للغاية لكميات صغيرة من البيانات. تعتمد الهياكل على شبكات التفافية واسعة غير قادرة على التقاط السمات الدلالية والمشاعر الكاملة لللهجات العربية. في هذه الورقة، تم اقتراح بنية ضيقة للشبكة العصبية الالتفافية (CNN) من أجل الحصول على تمثيلات التغريدات وتصنيف التغريدات العربية إلى خمسة وثلاثة واثنين من الاستقطاب. تم إجراء تحليل الحساسية لتقييم تأثير الخصائص الهيكلية المركبة المختلفة، مثل عدد المرشحات الالتفافية وحجم التجميع وحجم المرشح على أداء التصنيف. استحوذت الشبكة العصبية (NCNN) على كامل المعلومات الدلالية والمشاعر الواردة في التغريدة من خلال تعظيم ميزات نطاق الكاشف. تم تقدير أداء NCNN ليكون في أفضل حالاته عند هيكلته بثلاث طبقات التفافية، كل طبقة تليها طبقة التجميع القصوى. تم تطوير النموذج دون استخدام موارد المعجم والميزات المعجمية أو زيادة مجموعة البيانات ببيانات تدريب إضافية. النموذج الضيق هو النموذج الأساسي الأول لتصنيفات مشاعر اللهجات العربية لمستوى الجملة لأنه أول نموذج ضيق لشبكة CNN يتناول تغريدات اللهجة العربية. حقق نموذج CNN أدنى متوسط كلي لمتوسط الخطأ المطلق (MAE M ) لخمسة قطبية ومتوسط استدعاء ماكرو أعلى (P) لثلاثة واثنين من الأقطاب على مجموعات بيانات اللهجة العربية SemEval -2017 عند مقارنته بالنهج الأخرى للدولة من الفن. Les complexités et les enchevêtrements du dialecte arabe dans l'orthographe et la morphologie rendent généralement l'analyse sentimentale assez difficile. De plus, la plupart des approches de classification ont abordé ce problème sur la base de caractéristiques artisanales. Étant donné que la langue arabe a plusieurs dialectes et que la langue n'a pas d'ordre basé sur des mots, le processus d'extraction et les tâches de classification sont plus difficiles et prennent beaucoup de temps. Les approches de réseaux neuronaux profonds appliquées au colloque de la langue arabe sont très limitées. Ces approches profondes Les approches d'apprentissage comprennent généralement une structure très complexe pour de petites quantités de données. Les structures sont basées sur de larges réseaux convolutifs qui ne sont pas capables de capturer l'ensemble des caractéristiques sémantiques et sentimentales des dialectes arabes. Dans cet article, une structure étroite du réseau neuronal convolutif (CNN) a été proposée afin d'obtenir les représentations des tweets et de classer les tweets arabes en cinq, trois et deux polarités. Une analyse de sensibilité a été menée pour évaluer l'impact de diverses propriétés structurelles combinées, telles que le nombre de filtres convolutifs, la taille de la mise en commun et la taille du filtre sur les performances de classification. Le réseau neuronal (NCNN) a capturé l'ensemble des informations sémantiques et sentimentales contenues dans le tweet en maximisant les caractéristiques de la plage du détecteur. Les performances du NCNN ont été estimées optimales lorsqu'elles sont structurées par trois couches convolutionnelles, chacune suivie de la couche de mise en commun maximale. Le modèle a été développé sans utiliser de ressources de lexique et de caractéristiques lexicales ou a augmenté l'ensemble de données avec des données de formation supplémentaires. Le modèle étroit est le premier modèle de base pour les classifications de sentiment des dialectes arabes pour un niveau de phrase car il est le premier modèle CNN étroit traitant des tweets du dialecte arabe. Le modèle NCNN a atteint l'erreur absolue moyenne macro (MAE M ) la plus faible pour cinq polarités et un rappel moyen macro (P) pour trois et deux polarités sur les ensembles de données Twitter du dialecte arabe SemEval-2017 par rapport aux autres approches de pointe. Las complejidades y enredos del dialecto árabe en ortografía y morfología generalmente hacen que el análisis sentimental sea bastante desafiante. Además, la mayoría de los enfoques de clasificación han abordado este problema en función de características hechas a mano. Dado que el idioma árabe tiene múltiples dialectos y el idioma no tiene un orden basado en palabras, el proceso de extracción y las tareas de clasificación son más difíciles y requieren mucho tiempo. Los enfoques de redes neuronales profundas aplicados al idioma árabe coloquial son muy limitados. Estos profundos los enfoques de aprendizaje generalmente comprenden una estructura que es muy compleja para pequeñas cantidades de datos. Las estructuras se basan en redes convolucionales amplias que no son capaces de capturar todas las características semánticas y de sentimiento para los dialectos árabes. En este documento, se ha propuesto una estructura estrecha de la red neuronal convolucional (CNN) para obtener las representaciones de los tweets y clasificar los tweets árabes en cinco, tres y dos polaridades. Se ha realizado un análisis de sensibilidad para evaluar el impacto de varias propiedades estructurales de combinación, como el número de filtros convolucionales, el tamaño de la agrupación y el tamaño del filtro en las actuaciones de clasificación. La propuesta convolucional estrecha árabe la red neuronal (NCNN) ha capturado toda la información semántica y de sentimiento contenida en el tweet maximizando las características del rango del detector. Se estimó que el rendimiento de la NCNN era óptimo cuando estaba estructurado por tres capas convolucionales, cada una seguida de la capa de agrupación máxima. El modelo se ha desarrollado sin utilizar recursos de léxico y características léxicas ni ha aumentado el conjunto de datos con datos de entrenamiento adicionales. El modelo estrecho es el primer modelo de referencia para las clasificaciones de sentimiento de dialectos árabes para un nivel de oración, ya que es el primer modelo estrecho de CNN que aborda los tweets de dialecto árabe. El modelo de la NCNN logró el error absoluto promedio macro más bajo (MAE M ) para cinco polaridades y el recuerdo promedio macro más alto (P) para tres y dos polaridades en los conjuntos de datos de Twitter de dialectos árabes SemEval-2017 en comparación con los otros enfoques de vanguardia.

Licenses

Similar