Logo Lanfrica

Sentiment Summerization and Analysis of Sindhi Text تلخيص المشاعر وتحليل النص السندي Summerization du sentiment et analyse du texte sindhi Verificación de sentimientos y análisis del texto sindhi

Domain:

natural language processing

Record type:

dataset
Creator:
MazAsi
Publisher:
Ope
Host:avatar
Text corpus is important for assessment of language features and variation analysis. Machine learning techniques identify the language terms, features, text structures and sentiment from linguistic corpus. Sindhi language is one of the oldest languages of the world having proper script and complete grammar. Sindhi is remained less resourced language computationally even in this digital era. Viewing this problem of Sindhi language, Sindhi NLP toolkit is developed to solve the Sindhi NLP and computational linguistics problems. Therefore, this research work may be an addition to NLP. This research study has developed an own Sindhi sentimentally structured and analyzed corpus on the basis of accumulated results of Sindhi sentiment analysis tool. Corpus is normalized and analyzed for language features and variation analysis using DTM and TF-IDF techniques. DTM and TF-IDF analysis is performed using n-gram model. The supervised machine learning model is formulated using SVMs and K-NN techniques to perform analysis on Sindhi sentiment analysis corpus dataset. Precision, recall and f-score show better performance of machine learning technique than other techniques. Cross validation techniques is used with 10 folds to validate and evaluate data set randomly for supervised machine learning analysis. Research study opens doors for linguists, data analysts and decision makers to work more for sentiment summarization and visual tracking. مجموعة النصوص مهمة لتقييم ميزات اللغة وتحليل التباين. تحدد تقنيات التعلم الآلي مصطلحات اللغة والميزات وهياكل النص والمشاعر من المجموعة اللغوية. اللغة السندية هي واحدة من أقدم اللغات في العالم التي لديها نص مناسب وقواعد كاملة. لا تزال اللغة السندية أقل موارد من الناحية الحسابية حتى في هذا العصر الرقمي. بالنظر إلى مشكلة اللغة السندية هذه، تم تطوير مجموعة أدوات البرمجة اللغوية العصبية السندية لحل مشاكل البرمجة اللغوية العصبية السندية واللغويات الحسابية. لذلك، قد يكون هذا العمل البحثي إضافة إلى البرمجة اللغوية العصبية. طورت هذه الدراسة البحثية متنًا خاصًا بالسندية تم تنظيمه وتحليله عاطفيًا على أساس النتائج المتراكمة لأداة تحليل المشاعر السندية. يتم تطبيع المدونة وتحليلها لميزات اللغة وتحليل الاختلافات باستخدام تقنيات DTM و TF - IDF. يتم إجراء تحليل DTM و TF - IDF باستخدام نموذج n - gram. تتم صياغة نموذج التعلم الآلي الخاضع للإشراف باستخدام تقنيات SVMs و K - NN لإجراء تحليل على مجموعة بيانات تحليل المشاعر السندي. تُظهر الدقة والتذكر والدرجة f أداءً أفضل لتقنية التعلم الآلي مقارنة بالتقنيات الأخرى. تُستخدم تقنيات التحقق المتبادل مع 10 طيات للتحقق من صحة مجموعة البيانات وتقييمها عشوائيًا لتحليل التعلم الآلي الخاضع للإشراف. تفتح الدراسة البحثية الأبواب أمام اللغويين ومحللي البيانات وصانعي القرار للعمل بشكل أكبر من أجل تلخيص المشاعر والتتبع البصري. Le corpus textuel est important pour l'évaluation des caractéristiques du langage et l'analyse des variations. Les techniques d'apprentissage automatique identifient les termes linguistiques, les caractéristiques, les structures de texte et le sentiment à partir du corpus linguistique. La langue sindhi est l'une des plus anciennes langues du monde avec une écriture appropriée et une grammaire complète. Le sindhi est resté un langage moins doté en ressources informatiques, même en cette ère numérique. En examinant ce problème du langage sindhi, la boîte à outils de PNL sindhi est développée pour résoudre les problèmes de PNL sindhi et de linguistique computationnelle. Par conséquent, ce travail de recherche peut être un ajout à la PNL. Cette étude de recherche a développé un propre corpus Sindhi structuré et analysé sentimentalement sur la base des résultats accumulés de l'outil d'analyse du sentiment Sindhi. Le corpus est normalisé et analysé pour les caractéristiques du langage et l'analyse des variations à l'aide des techniques DTM et TF-IDF. L'analyse DTM et TF-IDF est effectuée à l'aide d'un modèle à n grammes. Le modèle d'apprentissage automatique supervisé est formulé à l'aide de SVM et de techniques K-NN pour effectuer une analyse sur l'ensemble de données du corpus d'analyse du sentiment sindhi. La précision, le rappel et le score f montrent de meilleures performances de la technique d'apprentissage automatique que d'autres techniques. Les techniques de validation croisée sont utilisées avec 10 plis pour valider et évaluer l'ensemble de données de manière aléatoire pour l'analyse supervisée de l'apprentissage automatique. L'étude de recherche ouvre des portes aux linguistes, aux analystes de données et aux décideurs pour qu'ils travaillent davantage à la synthèse des sentiments et au suivi visuel. El corpus de texto es importante para la evaluación de las características del lenguaje y el análisis de variaciones. Las técnicas de aprendizaje automático identifican los términos lingüísticos, las características, las estructuras de texto y el sentimiento del corpus lingüístico. El idioma sindhi es uno de los idiomas más antiguos del mundo con una escritura adecuada y una gramática completa. El sindhi sigue siendo un lenguaje con menos recursos desde el punto de vista computacional, incluso en esta era digital. Al ver este problema del lenguaje sindhi, el kit de herramientas de PNL sindhi se desarrolla para resolver problemas de PNL sindhi y lingüística computacional. Por lo tanto, este trabajo de investigación puede ser una adición a la PNL. Este estudio de investigación ha desarrollado un corpus propio de Sindhi estructurado y analizado sentimentalmente sobre la base de los resultados acumulados de la herramienta de análisis de sentimientos de Sindhi. El corpus se normaliza y analiza para las características del lenguaje y el análisis de variaciones utilizando técnicas DTM y TF-IDF. El análisis DTM y TF-IDF se realiza utilizando un modelo de n-gramas. El modelo de aprendizaje automático supervisado se formula utilizando técnicas SVM y K-NN para realizar análisis en el conjunto de datos del corpus de análisis de sentimientos Sindhi. La precisión, el recuerdo y la puntuación f muestran un mejor rendimiento de la técnica de aprendizaje automático que otras técnicas. Las técnicas de validación cruzada se utilizan con 10 pliegues para validar y evaluar el conjunto de datos aleatoriamente para el análisis de aprendizaje automático supervisado. El estudio de investigación abre las puertas para que lingüistas, analistas de datos y tomadores de decisiones trabajen más para el resumen de sentimientos y el seguimiento visual.

Licenses

Similar