Logo Lanfrica

Dialect & Sentiment Identification in Nuanced Arabic Tweets Using an Ensemble of Prompt-based, Fine-tuned, and Multitask BERT-Based Models تحديد اللهجة والعاطفة في التغريدات العربية الدقيقة باستخدام مجموعة من النماذج القائمة على المطالبة والضبط الدقيق والمتعددة المهام القائمة على BERT Identification du dialecte et du sentiment dans les tweets arabes nuancés à l'aide d'un ensemble de modèles BERT basés sur l'invite, affinés et multitâches Identificación de dialectos y sentimientos en tweets árabes matizados utilizando un conjunto de modelos basados en mensajes, afinados y multitarea basados en Bert

Domain:

natural language processing

Record type:

paper
Creator:
Ree
Publisher:
Ope
Host:avatar
Dialect Identification is important to improve the performance of various application as translation, speech recognition, etc.In this paper, we present our findings and results in the Nuanced Arabic Dialect Identification Shared Task (NADI 2022) for country-level dialect identification and sentiment identification for dialectical Arabic.The proposed model is an ensemble between fine-tuned BERT-based models and various approaches of prompt-tuning.Our model secured first place on the leaderboard for subtask 1 with an 27.06 F1-macro score, and subtask 2 secured first place with 75.15 F1-PN score.Our findings show that prompt-tuning-based models achieved better performance when compared to fine-tuning and Multi-task based methods.Moreover, using an ensemble of different loss functions might improve model performance. تحديد اللهجة مهم لتحسين أداء التطبيقات المختلفة مثل الترجمة والتعرف على الكلام وما إلى ذلك. في هذه الورقة، نقدم نتائجنا ونتائجنا في المهمة المشتركة لتحديد اللهجة العربية الدقيقة (نادي 2022) لتحديد اللهجة على المستوى القطري وتحديد المشاعر للغة العربية الجدلية. النموذج المقترح هو مجموعة بين النماذج القائمة على BERT المضبوطة والنهج المختلفة للضبط الفوري. حصل نموذجنا على المركز الأول في قائمة المتصدرين للمهمة الفرعية 1 بدرجة 27.06 F1 ماكرو، وحصلت المهمة الفرعية 2 على المركز الأول بدرجة 75.15 F1 - PN. تظهر نتائجنا أن النماذج القائمة على الضبط الفوري حققت أداءً أفضل عند مقارنتها بالضبط الدقيق والأساليب القائمة على المهام المتعددة. علاوة على ذلك، باستخدام مجموعة من وظائف الخسارة المختلفة قد تحسن أداء النموذج. L'identification du dialecte est importante pour améliorer les performances de diverses applications telles que la traduction, la reconnaissance vocale, etc. Dans cet article, nous présentons nos conclusions et résultats dans la tâche partagée d'identification du dialecte arabe nuancé (NADI 2022) pour l'identification du dialecte au niveau du pays et l'identification du sentiment pour l'arabe dialectique. Le modèle proposé est un ensemble entre les modèles BERT affinés et diverses approches de réglage rapide. Notre modèle a obtenu la première place dans le classement pour la sous-tâche 1 avec un score de 27,06 F1-macro, et la sous-tâche 2 a obtenu la première place avec un score de 75,15 F1-PN. Nos résultats montrent que les modèles basés sur le réglage rapide ont obtenu de meilleures performances par rapport aux méthodes basées sur le réglage fin et le multitâche. De plus, l'utilisation d'un ensemble de différentes fonctions de perte pourrait améliorer les performances du modèle. La identificación de dialectos es importante para mejorar el rendimiento de diversas aplicaciones como la traducción, el reconocimiento de voz, etc. En este documento, presentamos nuestros hallazgos y resultados en la tarea compartida de identificación de dialectos árabes matizados (NADI 2022) para la identificación de dialectos a nivel de país y la identificación de sentimientos para el árabe dialéctico. El modelo propuesto es un conjunto entre modelos basados en Bert ajustados y varios enfoques de ajuste rápido. Nuestro modelo obtuvo el primer lugar en la tabla de clasificación para la subtarea 1 con una puntuación de 27.06 F1-macro, y la subtarea 2 obtuvo el primer lugar con una puntuación de 75.15 F1-PN. Nuestros hallazgos muestran que los modelos basados en ajuste rápido lograron un mejor rendimiento en comparación con los métodos basados en ajuste fino y multitarea. Además, el uso de un conjunto de diferentes funciones de pérdida podría mejorar el rendimiento del modelo.

Languages

Licenses

Similar