Logo Lanfrica

Benchmarking transfer learning approaches for sentiment analysis of Arabic dialect المقارنات المعيارية لنقل مناهج التعلم لتحليل معنويات اللهجة العربية Analyse comparative des approches d'apprentissage par transfert pour l'analyse des sentiments du dialecte arabe Evaluación comparativa de enfoques de aprendizaje por transferencia para el análisis de sentimientos del dialecto árabe

Domain:

natural language processing

Record type:

paper
Creator:
EmnSamRahLam
Publisher:
Ope
Host:avatar
Arabic has a widely varying collection of dialects.With the explosion of the use of social networks, the volume of written texts has remarkably increased.Most users express themselves using their own dialect.Unfortunately, many of these dialects remain under-studied due to the scarcity of resources.Researchers and industry practitioners are increasingly interested in analyzing users' sentiments.In this context, several approaches have been proposed, namely: traditional machine learning, deep learning transfer learning and more recently few-shot learning approaches.In this work, we compare their efficiency as part of the NADI competition to develop a country-level sentiment analysis model.Three models were beneficial for this sub-task: The first based on Sentence Transformer (ST) and achieve 43.23% on DEV set and 42.33% on TEST set, the second based on CAMeLBERT and achieve 54.00% on DEV set and 43.11% on TEST set and the third based on multi-dialect BERT model and achieve 66.72% on DEV set and 39.69% on TEST set. تحتوي اللغة العربية على مجموعة متنوعة من اللهجات. مع انفجار استخدام الشبكات الاجتماعية، زاد حجم النصوص المكتوبة بشكل ملحوظ. معظم المستخدمين يعبرون عن أنفسهم باستخدام لهجتهم الخاصة. لسوء الحظ، لا تزال العديد من هذه اللهجات غير مدروسة بشكل كافٍ بسبب ندرة الموارد. يهتم الباحثون والممارسون الصناعيون بشكل متزايد بتحليل مشاعر المستخدمين. في هذا السياق، تم اقتراح عدة مناهج، وهي: التعلم الآلي التقليدي، والتعلم العميق لنقل التعلم، ومؤخراً مناهج التعلم القليلة. في هذا العمل، نقارن كفاءتها كجزء من مسابقة نادي لتطوير نموذج تحليل المشاعر على المستوى القطري. كانت ثلاثة نماذج مفيدة لهذه المهمة الفرعية: الأولى تستند إلى محول الجمل (ST) وتحقق 43.23 ٪ على مجموعة الانحراف و 42.33 ٪ على مجموعة الاختبار، والثانية تستند إلى CAMeLBERT وتحقق 54.00 ٪ على مجموعة الانحراف و 43.11 ٪ على مجموعة الاختبار والثالثة تستند إلى نموذج BERT وتحقيق 66.72 ٪ على مجموعة الانحراف و 39.69 ٪ على مجموعة الاختبار. L'arabe a une collection très variée de dialectes. Avec l'explosion de l'utilisation des réseaux sociaux, le volume de textes écrits a considérablement augmenté. La plupart des utilisateurs s'expriment en utilisant leur propre dialecte. Malheureusement, beaucoup de ces dialectes restent sous-étudiés en raison de la rareté des ressources. Les chercheurs et les praticiens de l'industrie sont de plus en plus intéressés par l'analyse des sentiments des utilisateurs. Dans ce contexte, plusieurs approches ont été proposées, à savoir : l'apprentissage automatique traditionnel, l'apprentissage par transfert en apprentissage profond et plus récemment quelques approches d'apprentissage. Dans ce travail, nous comparons leur efficacité dans le cadre du concours NADI pour développer un modèle d'analyse des sentiments au niveau national. Trois modèles ont été bénéfiques pour cette sous-tâche : Le premier basé sur le transformateur de phrase (ST) et atteint 43,23% sur le DEV set et 42,33% sur le TEST set, le second basé sur CAMeLBERT et atteint 54,00% sur le DEV set et 43,11% sur le TEST set et le troisième basé sur le modèle BERT multi-dialectes et atteint 66,72% sur le DEV set et 39,69% sur le TEST set. El árabe tiene una colección de dialectos muy variada. Con la explosión del uso de las redes sociales, el volumen de textos escritos ha aumentado notablemente. La mayoría de los usuarios se expresan utilizando su propio dialecto. Desafortunadamente, muchos de estos dialectos siguen siendo poco estudiados debido a la escasez de recursos. Los investigadores y los profesionales de la industria están cada vez más interesados en analizar los sentimientos de los usuarios. En este contexto, se han propuesto varios enfoques, a saber: aprendizaje automático tradicional, aprendizaje de transferencia de aprendizaje profundo y, más recientemente, enfoques de aprendizaje de pocas tomas. En este trabajo, comparamos su eficiencia como parte de la competencia NADI para desarrollar un modelo de análisis de sentimientos a nivel de país. Tres modelos fueron beneficiosos para esta subtarea: el primero basado en el transformador de oraciones (ST) y logró el 43.23% en el conjunto DEV y el 42.33% en el conjunto de PRUEBAS, el segundo basado en CAMeLBERT y logró el 54.00% en el conjunto DEV y el 43.11% en el conjunto de PRUEBAS y el tercero basado en el modelo BERT multidialectal y logró el 66.72% en el conjunto DEV y el 39.69% en el conjunto de PRUEBAS.

Languages

Licenses

Similar