Logo Lanfrica

Deep-WET: a deep learning-based approach for predicting DNA-binding proteins using word embedding techniques with weighted features Deep - WET: نهج قائم على التعلم العميق للتنبؤ بالبروتينات المرتبطة بالحمض النووي باستخدام تقنيات تضمين الكلمات ذات الميزات المرجحة Deep-WET : une approche basée sur l'apprentissage profond pour prédire les protéines de liaison à l'ADN à l'aide de techniques d'intégration de mots avec des caractéristiques pondérées Deep-WET: un enfoque basado en el aprendizaje profundo para predecir proteínas de unión al ADN utilizando técnicas de incrustación de palabras con características ponderadas

Domaine:

healthcare

Type de record:

datasetmodel
Créateur:
SakMicMd.Dip
Éditeur:
Ope
Hôte:avatar
Abstract DNA-binding proteins (DBPs) play a significant role in all phases of genetic processes, including DNA recombination, repair, and modification. They are often utilized in drug discovery as fundamental elements of steroids, antibiotics, and anticancer drugs. Predicting them poses the most challenging task in proteomics research. Conventional experimental methods for DBP identification are costly and sometimes biased toward prediction. Therefore, developing powerful computational methods that can accurately and rapidly identify DBPs from sequence information is an urgent need. In this study, we propose a novel deep learning-based method called Deep-WET to accurately identify DBPs from primary sequence information. In Deep-WET, we employed three powerful feature encoding schemes containing Global Vectors, Word2Vec, and fastText to encode the protein sequence. Subsequently, these three features were sequentially combined and weighted using the weights obtained from the elements learned through the differential evolution (DE) algorithm. To enhance the predictive performance of Deep-WET, we applied the SHapley Additive exPlanations approach to remove irrelevant features. Finally, the optimal feature subset was input into convolutional neural networks to construct the Deep-WET predictor. Both cross-validation and independent tests indicated that Deep-WET achieved superior predictive performance compared to conventional machine learning classifiers. In addition, in extensive independent test, Deep-WET was effective and outperformed than several state-of-the-art methods for DBP prediction, with accuracy of 78.08%, MCC of 0.559, and AUC of 0.805. This superior performance shows that Deep-WET has a tremendous predictive capacity to predict DBPs. The web server of Deep-WET and curated datasets in this study are available at deepwet-dna.monarcatechnica… . The proposed Deep-WET is anticipated to serve the community-wide effort for large-scale identification of potential DBPs. تلعب البروتينات المجردة المرتبطة بالحمض النووي (DBPs) دورًا مهمًا في جميع مراحل العمليات الوراثية، بما في ذلك إعادة تركيب الحمض النووي وإصلاحه وتعديله. غالبًا ما يتم استخدامها في اكتشاف الأدوية كعناصر أساسية للستيرويدات والمضادات الحيوية والأدوية المضادة للسرطان. يشكل التنبؤ بها المهمة الأكثر تحديًا في أبحاث البروتيوميات. الطرق التجريبية التقليدية لتحديد DBP مكلفة وأحيانًا منحازة نحو التنبؤ. لذلك، فإن تطوير طرق حسابية قوية يمكنها تحديد DBPs بدقة وسرعة من معلومات التسلسل هو حاجة ملحة. في هذه الدراسة، نقترح طريقة جديدة قائمة على التعلم العميق تسمى Deep - WET لتحديد DBPs بدقة من معلومات التسلسل الأولية. في Deep - WET، استخدمنا ثلاثة مخططات ترميز ميزات قوية تحتوي على Global Vectors و Word2Vec و fastText لتشفير تسلسل البروتين. في وقت لاحق، تم الجمع بين هذه السمات الثلاث وترجيحها بالتتابع باستخدام الأوزان التي تم الحصول عليها من العناصر التي تم تعلمها من خلال خوارزمية التطور التفاضلي (DE). لتعزيز الأداء التنبئي لـ Deep - WET، طبقنا نهج SHapley Additive exPlanations لإزالة الميزات غير ذات الصلة. أخيرًا، كانت المجموعة الفرعية المثلى للميزة هي الإدخال في الشبكات العصبية الالتفافية لبناء مؤشر Deep - WET. أشارت كل من اختبارات التحقق المتبادل والاختبارات المستقلة إلى أن Deep - WET حققت أداءً تنبؤيًا متفوقًا مقارنة بمصنفات التعلم الآلي التقليدية. بالإضافة إلى ذلك، في اختبار مستقل مكثف، كان Deep - WET فعالًا ومتفوقًا على العديد من الطرق الحديثة للتنبؤ بـ DBP، بدقة 78.08 ٪، و MCC من 0.559، و AUC من 0.805. يوضح هذا الأداء المتفوق أن Deep - WET لديها قدرة تنبؤية هائلة للتنبؤ بـ DBPs. يتوفر خادم الويب الخاص بـ Deep - WET ومجموعات البيانات المنسقة في هذه الدراسة على deepwet-dna.monarcatechnica… . من المتوقع أن يخدم مشروع Deep - WET المقترح الجهود المبذولة على مستوى المجتمع المحلي لتحديد الممارسات التجارية التقييدية المحتملة على نطاق واسع. Les protéines de liaison à l'ADN abstraites (DBP) jouent un rôle important dans toutes les phases des processus génétiques, y compris la recombinaison, la réparation et la modification de l'ADN. Ils sont souvent utilisés dans la découverte de médicaments comme éléments fondamentaux des stéroïdes, des antibiotiques et des médicaments anticancéreux. Les prédire pose la tâche la plus difficile de la recherche en protéomique. Les méthodes expérimentales conventionnelles d'identification de la PAD sont coûteuses et parfois biaisées en faveur de la prédiction. Par conséquent, il est urgent de développer des méthodes de calcul puissantes capables d'identifier avec précision et rapidité les DBP à partir d'informations de séquence. Dans cette étude, nous proposons une nouvelle méthode basée sur l'apprentissage profond appelée Deep-WET pour identifier avec précision les DBP à partir des informations de séquence primaire. Dans Deep-WET, nous avons utilisé trois puissants schémas de codage de caractéristiques contenant Global Vectors, Word2Vec et fastText pour coder la séquence protéique. Par la suite, ces trois caractéristiques ont été séquentiellement combinées et pondérées à l'aide des pondérations obtenues à partir des éléments appris par l'algorithme d'évolution différentielle (DE). Pour améliorer les performances prédictives de Deep-WET, nous avons appliqué l'approche SHapley Additive exPlanations pour supprimer les fonctionnalités non pertinentes. Enfin, le sous-ensemble de caractéristiques optimal a été entré dans des réseaux neuronaux convolutionnels pour construire le prédicteur Deep-WET. La validation croisée et les tests indépendants ont indiqué que Deep-WET a atteint des performances prédictives supérieures par rapport aux classificateurs d'apprentissage automatique conventionnels. De plus, lors d'un test indépendant approfondi, Deep-WET s'est avéré efficace et a surpassé plusieurs méthodes de pointe pour la prédiction de la PAD, avec une précision de 78,08 %, un CMC de 0,559 et une ASC de 0,805. Cette performance supérieure montre que Deep-WET a une énorme capacité prédictive pour prédire les SPD. Le serveur Web de Deep-WET et les ensembles de données conservés dans cette étude sont disponibles sur deepwet-dna.monarcatechnica… . Le Deep-WET proposé devrait servir l'effort à l'échelle de la communauté pour l'identification à grande échelle des DBP potentiels. Las proteínas de unión al ADN (DBP) abstractas desempeñan un papel importante en todas las fases de los procesos genéticos, incluida la recombinación, reparación y modificación del ADN. A menudo se utilizan en el descubrimiento de fármacos como elementos fundamentales de esteroides, antibióticos y fármacos contra el cáncer. Predecirlos plantea la tarea más desafiante en la investigación proteómica. Los métodos experimentales convencionales para la identificación de DBP son costosos y, a veces, sesgados hacia la predicción. Por lo tanto, es una necesidad urgente desarrollar métodos computacionales potentes que puedan identificar con precisión y rapidez los DBP a partir de la información de la secuencia. En este estudio, proponemos un nuevo método basado en el aprendizaje profundo llamado Deep-WET para identificar con precisión los DBP a partir de la información de la secuencia primaria. En Deep-WET, empleamos tres potentes esquemas de codificación de características que contienen Global Vectors, Word2Vec y fastText para codificar la secuencia de proteínas. Posteriormente, estas tres características se combinaron secuencialmente y se ponderaron utilizando los pesos obtenidos de los elementos aprendidos a través del algoritmo de evolución diferencial (DE). Para mejorar el rendimiento predictivo de Deep-WET, aplicamos el enfoque SHapley Additive exPlanations para eliminar características irrelevantes. Finalmente, el subconjunto de características óptimas se introdujo en redes neuronales convolucionales para construir el predictor Deep-WET. Tanto la validación cruzada como las pruebas independientes indicaron que Deep-WET logró un rendimiento predictivo superior en comparación con los clasificadores de aprendizaje automático convencionales. Además, en una extensa prueba independiente, Deep-WET fue eficaz y superó a varios métodos de vanguardia para la predicción de DBP, con una precisión del 78,08%, MCC de 0,559 y AUC de 0,805. Este rendimiento superior muestra que Deep-WET tiene una tremenda capacidad predictiva para predecir DBP. El servidor web de Deep-WET y los conjuntos de datos seleccionados en este estudio están disponibles en deepwet-dna.monarcatechnica… . Se prevé que la Deep-WET propuesta sirva al esfuerzo de toda la comunidad para la identificación a gran escala de posibles DBP.

Languages

Licenses

Similaires