Logo Lanfrica

Building lexicon-based sentiment analysis model for low-resource languages بناء نموذج تحليل المشاعر القائم على المعجم للغات منخفضة الموارد Construire un modèle d'analyse des sentiments basé sur le lexique pour les langues à faibles ressources Creación de un modelo de análisis de sentimientos basado en léxico para lenguajes de bajos recursos

Domain:

natural language processing

Record type:

model
Creator:
IdiRaj
Publisher:
Ope
Host:avatar
Natural Language Processing (NLP) has transformed machine translation, sentiment analysis, information retrieval, and conversation systems. NLP applications rely on complete linguistic resources, which might be difficult for low-resource languages. NLP solutions for every language require a language-specific dataset. Dataset in a language is essential for NLP solution creation. Over 7000 languages are spoken worldwide. Only around 20 languages have text corpora for NLP applications. English has the most datasets, then Chinese and Spanish. Japanese has several Western European language datasets. For an accurate NLP system, most Asian and African languages lack training datasets. To address this challenge, we propose a methodology for building a lexicon-based sentiment analysis model for languages with limited resources. The Hausa language was used as training and evaluation language. The methodology combines lexicon creation; augmentation, annotation, and fine-tuning model, and has been tested on a corpus of Hausa tweets achieving an accuracy of 98 %. The results suggest that our proposed model is a promising tool for sentiment analysis in a variety of applications, such as social media monitoring, customer service, and market research. Our methodology can be used for any low-resource language. The outline of the work done in this paper can be shown as follows:•We propose a methodology for building a lexicon-based sentiment analysis model for languages with limited resources, using the Hausa language as a case study.•The methodology combines lexicon creation, augmentation, annotation, and fine-tuning model, and achieves an accuracy of 98 % on a corpus of Hausa tweets.•The results suggest that the proposed model is a promising tool for sentiment analysis in a variety of applications for low-resource languages. حولت معالجة اللغة الطبيعية (NLP) أنظمة الترجمة الآلية وتحليل المشاعر واسترجاع المعلومات والمحادثة. تعتمد تطبيقات البرمجة اللغوية العصبية على الموارد اللغوية الكاملة، والتي قد تكون صعبة على اللغات منخفضة الموارد. تتطلب حلول البرمجة اللغوية العصبية لكل لغة مجموعة بيانات خاصة بكل لغة. تعد مجموعة البيانات باللغة ضرورية لإنشاء حل البرمجة اللغوية العصبية. يتم التحدث بأكثر من 7000 لغة في جميع أنحاء العالم. تحتوي حوالي 20 لغة فقط على مجموعة نصية لتطبيقات البرمجة اللغوية العصبية. تحتوي اللغة الإنجليزية على معظم مجموعات البيانات، ثم الصينية والإسبانية. لدى اللغة اليابانية العديد من مجموعات بيانات اللغات الأوروبية الغربية. بالنسبة لنظام البرمجة اللغوية العصبية الدقيق، تفتقر معظم اللغات الآسيوية والأفريقية إلى مجموعات بيانات التدريب. ولمواجهة هذا التحدي، نقترح منهجية لبناء نموذج تحليل المشاعر القائم على المعجم للغات ذات الموارد المحدودة. تم استخدام لغة الهوسا كلغة تدريب وتقييم. تجمع المنهجية بين إنشاء المعجم ؛ والتكبير، والتعليق التوضيحي، ونموذج الضبط الدقيق، وقد تم اختبارها على مجموعة من تغريدات الهوسا التي حققت دقة 98 ٪. تشير النتائج إلى أن نموذجنا المقترح هو أداة واعدة لتحليل المشاعر في مجموعة متنوعة من التطبيقات، مثل مراقبة وسائل التواصل الاجتماعي وخدمة العملاء وأبحاث السوق. يمكن استخدام منهجيتنا لأي لغة منخفضة الموارد. يمكن عرض الخطوط العريضة للعمل المنجز في هذه الورقة على النحو التالي:•نقترح منهجية لبناء نموذج تحليل المشاعر القائم على المعجم للغات ذات الموارد المحدودة، باستخدام لغة الهوسا كدراسة حالة.• تجمع المنهجية بين إنشاء المعجم والتكبير والتعليق التوضيحي ونموذج الضبط الدقيق، وتحقق دقة بنسبة 98 ٪ على مجموعة من تغريدات الهوسا.• تشير النتائج إلى أن النموذج المقترح هو أداة واعدة لتحليل المشاعر في مجموعة متنوعة من التطبيقات للغات منخفضة الموارد. Natural Language Processing (NLP) a transformé la traduction automatique, l'analyse des sentiments, la récupération d'informations et les systèmes de conversation. Les applications de PNL reposent sur des ressources linguistiques complètes, ce qui peut être difficile pour les langues à faibles ressources. Les solutions de PNL pour chaque langue nécessitent un ensemble de données spécifiques à la langue. L'ensemble de données dans une langue est essentiel pour la création de solutions de PNL. Plus de 7 000 langues sont parlées dans le monde. Seules une vingtaine de langues ont des corpus textuels pour les applications de PNL. L'anglais a le plus grand nombre d'ensembles de données, puis le chinois et l'espagnol. Le japonais dispose de plusieurs ensembles de données sur les langues d'Europe occidentale. Pour un système de PNL précis, la plupart des langues asiatiques et africaines manquent d'ensembles de données de formation. Pour relever ce défi, nous proposons une méthodologie pour construire un modèle d'analyse du sentiment basé sur le lexique pour les langues avec des ressources limitées. La langue haoussa a été utilisée comme langue de formation et d'évaluation. La méthodologie combine la création de lexique ; modèle d'augmentation, d'annotation et de réglage fin, et a été testée sur un corpus de tweets Hausa atteignant une précision de 98 %. Les résultats suggèrent que notre modèle proposé est un outil prometteur pour l'analyse des sentiments dans une variété d'applications, telles que la surveillance des médias sociaux, le service à la clientèle et les études de marché. Notre méthodologie peut être utilisée pour tout langage à faibles ressources. Les grandes lignes du travail effectué dans cet article peuvent être présentées comme suit :•Nous proposons une méthodologie pour construire un modèle d'analyse des sentiments basé sur le lexique pour les langues avec des ressources limitées, en utilisant la langue haoussa comme étude de cas.•La méthodologie combine la création de lexique, l'augmentation, l'annotation et le modèle de réglage fin, et atteint une précision de 98 % sur un corpus de tweets haoussa.•Les résultats suggèrent que le modèle proposé est un outil prometteur pour l'analyse des sentiments dans une variété d'applications pour les langues à faibles ressources. El procesamiento del lenguaje natural (PNL) ha transformado la traducción automática, el análisis de sentimientos, la recuperación de información y los sistemas de conversación. Las aplicaciones de PNL se basan en recursos lingüísticos completos, lo que puede ser difícil para los idiomas de bajos recursos. Las soluciones de PNL para cada idioma requieren un conjunto de datos específico para cada idioma. El conjunto de datos en un idioma es esencial para la creación de soluciones de PNL. Se hablan más de 7000 idiomas en todo el mundo. Solo alrededor de 20 idiomas tienen corpus de texto para aplicaciones de PNL. El inglés tiene la mayoría de los conjuntos de datos, luego el chino y el español. El japonés tiene varios conjuntos de datos lingüísticos de Europa occidental. Para un sistema de PNL preciso, la mayoría de los idiomas asiáticos y africanos carecen de conjuntos de datos de capacitación. Para abordar este desafío, proponemos una metodología para construir un modelo de análisis de sentimientos basado en léxico para idiomas con recursos limitados. Se utilizó el idioma hausa como lenguaje de formación y evaluación. La metodología combina la creación de léxico; modelo de aumento, anotación y ajuste fino, y ha sido probada en un corpus de tweets Hausa logrando una precisión del 98%. Los resultados sugieren que nuestro modelo propuesto es una herramienta prometedora para el análisis de sentimientos en una variedad de aplicaciones, como el monitoreo de redes sociales, el servicio al cliente y la investigación de mercado. Nuestra metodología se puede utilizar para cualquier idioma de bajos recursos. El resumen del trabajo realizado en este documento se puede mostrar de la siguiente manera:•Proponemos una metodología para construir un modelo de análisis de sentimientos basado en léxico para idiomas con recursos limitados, utilizando el idioma hausa como estudio de caso.•La metodología combina la creación de léxico, el aumento, la anotación y el modelo de ajuste fino, y logra una precisión del 98 % en un corpus de tweets hausa.•Los resultados sugieren que el modelo propuesto es una herramienta prometedora para el análisis de sentimientos en una variedad de aplicaciones para idiomas de bajos recursos.

Licenses

Similar