Logo Lanfrica

Modified Genetic Algorithm for Feature Selection and Hyper Parameter Optimization: Case of XGBoost in Spam Prediction الخوارزمية الجينية المعدلة لاختيار الميزات وتحسين المعلمات الفائقة: حالة XGBoost في التنبؤ بالبريد العشوائي Algorithme génétique modifié pour la sélection des fonctionnalités et l'optimisation de l'hyperparamètre : cas de XGBoost dans la prédiction du spam Algoritmo genético modificado para la selección de características y la optimización de hiperparámetros: caso de XGBoost en la predicción de spam

Domaine:

natural language processing

Type de record:

paper
Créateur:
NazIsmKha
Éditeur:
Ope
Hôte:avatar
Recently, spam on online social networks has attracted attention in the research and business world. Twitter has become the preferred medium to spread spam content. Many research efforts attempted to encounter social networks spam. Twitter brought extra challenges represented by the feature space size, and imbalanced data distributions. Usually, the related research works focus on part of these main challenges or produce black-box models. In this paper, we propose a modified genetic algorithm for simultaneous dimensionality reduction and hyper parameter optimization over imbalanced datasets. The algorithm initialized an eXtreme Gradient Boosting classifier and reduced the features space of tweets dataset; to generate a spam prediction model. The model is validated using a 50 times repeated 10-fold stratified cross-validation, and analyzed using nonparametric statistical tests. The resulted prediction model attains on average 82.32\% and 92.67\% in terms of geometric mean and accuracy respectively, utilizing less than 10\% of the total feature space. The empirical results show that the modified genetic algorithm outperforms $Chi^2$ and $PCA$ feature selection methods. In addition, eXtreme Gradient Boosting outperforms many machine learning algorithms, including BERT-based deep learning model, in spam prediction. Furthermore, the proposed approach is applied to SMS spam modeling and compared to related works. في الآونة الأخيرة، جذبت الرسائل غير المرغوب فيها على الشبكات الاجتماعية عبر الإنترنت الانتباه في عالم الأبحاث والأعمال. أصبح تويتر الوسيلة المفضلة لنشر محتوى البريد العشوائي. حاولت العديد من الجهود البحثية مواجهة الرسائل غير المرغوب فيها على الشبكات الاجتماعية. جلبت تويتر تحديات إضافية تمثلت في حجم مساحة الميزة، وتوزيع البيانات غير المتوازن. عادة، تركز الأعمال البحثية ذات الصلة على جزء من هذه التحديات الرئيسية أو تنتج نماذج الصندوق الأسود. في هذه الورقة، نقترح خوارزمية وراثية معدلة لتقليل الأبعاد المتزامنة وتحسين المعلمات المفرطة على مجموعات البيانات غير المتوازنة. قامت الخوارزمية بتهيئة مصنف eXtreme Gradient Boosting وخفضت مساحة ميزات مجموعة بيانات التغريدات ؛ لإنشاء نموذج تنبؤ بالبريد العشوائي. يتم التحقق من صحة النموذج باستخدام 50 مرة متكررة 10 أضعاف التحقق المتبادل الطبقية، وتحليلها باستخدام الاختبارات الإحصائية غير البارامترية. يحقق نموذج التنبؤ الناتج في المتوسط 82.32 \٪ و 92.67 \٪ من حيث المتوسط الهندسي والدقة على التوالي، باستخدام أقل من 10 \٪ من إجمالي مساحة الميزة. تظهر النتائج التجريبية أن الخوارزمية الجينية المعدلة تتفوق على طرق اختيار ميزات $CHI^2 $ و $ PCA$. بالإضافة إلى ذلك، يتفوق eXtreme Gradient Boosting على العديد من خوارزميات التعلم الآلي، بما في ذلك نموذج التعلم العميق القائم على BERT، في التنبؤ بالرسائل غير المرغوب فيها. علاوة على ذلك، يتم تطبيق النهج المقترح على نمذجة الرسائل غير المرغوب فيها ومقارنتها بالأعمال ذات الصلة. Récemment, le spam sur les réseaux sociaux en ligne a attiré l'attention dans le monde de la recherche et des affaires. Twitter est devenu le moyen privilégié pour diffuser du contenu indésirable. De nombreux efforts de recherche ont tenté de rencontrer du spam sur les réseaux sociaux. Twitter a apporté des défis supplémentaires représentés par la taille de l'espace des fonctionnalités et des distributions de données déséquilibrées. Habituellement, les travaux de recherche connexes se concentrent sur une partie de ces principaux défis ou produisent des modèles de boîte noire. Dans cet article, nous proposons un algorithme génétique modifié pour la réduction simultanée de la dimensionnalité et l'optimisation des hyperparamètres sur des ensembles de données déséquilibrés. L'algorithme a initialisé un classificateur eXtreme Gradient Boosting et réduit l'espace de fonctionnalités de l'ensemble de données de tweets ; pour générer un modèle de prédiction de spam. Le modèle est validé à l'aide d'une validation croisée stratifiée 10 fois répétée, et analysé à l'aide de tests statistiques non paramétriques. Le modèle de prédiction obtenu atteint en moyenne 82,32\% et 92,67\% en termes de moyenne géométrique et de précision respectivement, en utilisant moins de 10\% de l'espace total des caractéristiques. Les résultats empiriques montrent que l'algorithme génétique modifié surpasse les méthodes de sélection des caractéristiques $Chi^2 $ et $ PCA$ . En outre, eXtreme Gradient Boosting surpasse de nombreux algorithmes d'apprentissage automatique, y compris le modèle d'apprentissage profond basé sur BERT, dans la prédiction du spam. En outre, l'approche proposée est appliquée à la modélisation du spam par SMS et comparée à des travaux connexes. Recientemente, el spam en las redes sociales online ha llamado la atención en el mundo de la investigación y los negocios. Twitter se ha convertido en el medio preferido para difundir contenido spam. Muchos esfuerzos de investigación intentaron encontrar spam en las redes sociales. Twitter trajo desafíos adicionales representados por el tamaño del espacio de funciones y las distribuciones de datos desequilibradas. Por lo general, los trabajos de investigación relacionados se centran en parte de estos desafíos principales o producen modelos de caja negra. En este artículo, proponemos un algoritmo genético modificado para la reducción simultánea de la dimensionalidad y la optimización de hiperparámetros sobre conjuntos de datos desequilibrados. El algoritmo inicializó un clasificador eXtreme Gradient Boosting y redujo el espacio de características del conjunto de datos de tweets; para generar un modelo de predicción de spam. El modelo se valida utilizando una validación cruzada estratificada de 10 veces repetida 50 veces y se analiza utilizando pruebas estadísticas no paramétricas. El modelo de predicción resultante alcanza en promedio 82.32\% y 92.67\% en términos de media geométrica y precisión respectivamente, utilizando menos del 10\% del espacio de características total. Los resultados empíricos muestran que el algoritmo genético modificado supera a los métodos de selección de características $Chi^2 $ y $ PCA$. Además, eXtreme Gradient Boosting supera a muchos algoritmos de aprendizaje automático, incluido el modelo de aprendizaje profundo basado en Bert, en la predicción de spam. Además, el enfoque propuesto se aplica al modelado de spam de SMS y se compara con trabajos relacionados.

Licenses

Similaires