Logo Lanfrica

Enhanced Diagnostic and Interpretable Model for Febrile Diseases Using Explainable AI and Large Language Model Modèle diagnostique amélioré et interprétable pour les maladies fébriles utilisant l’intelligence artificielle explicable et les grands modèles de langage

Domaine:

healthcare

Type de record:

papermodel
Créateur:
Att
Éditeur:
IgnIgnProDr
Éditeur:
CCSDZenodo
Hôte:avatar
Tropical febrile diseases pose significant public health challenges in tropical regions, particularly in resource-limited settings, where timely and accurate diagnoses are critical for effective disease management. However, existing diagnostic systems are black-box and often lack interpretability, making it difficult for healthcare practitioners to understand and trust machine learning (ML) predictions. Additionally, the existing system excludes younger patients, limiting its applicability. This study aimed to develop an integrated diagnostic system that enhances interpretability by leveraging machine learning (ML), Explainable AI (XAI), and a large language model (LLM). A dataset comprising 3,914 patient records with 32 symptoms was obtained from a New Frontiers in Research Fund-sponsored project and preprocessed for analysis. Random Forest (RF) was trained with hyperparameter tuning using GridSearchCV and evaluated with 5-fold cross-validation to optimize its performance. The tuned model achieved high diagnostic performance, demonstrating its effectiveness in diagnosing six febrile diseases. To enhance interpretability, a Model Interpretability Framework (MIF) was incorporated, integrating Local Interpretable Model-Agnostic Explanations (LIME) for visual insights and ChatGPT for textual explanations. This combination provided users with a clear understanding of the diagnostic process, addressing the limitations of black-box ML models. The system was implemented using Python in a development environment that included Google Colaboratory, Visual Studio Code, Flet, and MySQL for database management. Agile development methodology and Unified Modeling Language tools were employed to create a user-friendly design for clinicians and patients. The diagnostic system was evaluated using precision, recall, F1-score, and AUC-ROC metrics. The RF model achieved outstanding precision for most diseases, high recall (≥0.97), and an AUC-ROC of 0.99, indicating nearly flawless training performance with few misclassifications. On the test dataset, the model performed better in diagnosing malaria (F1-score = 88%, precision = 85%), urinary tract infection (F1-score = 72%, precision = 80%), and respiratory tract infection (F1-score = 72%, precision = 77%). The evaluated system demonstrated strong predictive performance, correctly identifying 72 out of 99 tested patient cases, with 26 cases misclassified and one case completely missed. It achieved the highest detection rates for malaria and HIV/AIDS, accurately identifying all cases without false positives. This work enhances diagnostic solutions for tropical healthcare settings by improving explainability and ensuring inclusivity for younger patients, addressing key limitations in existing systems. The integration of ML, XAI, and LLM enhances diagnostic performance and lays the groundwork for future AI-driven healthcare innovations, ultimately improving health outcomes in resource-scarce regions. Healthcare providers should adopt this system to enhance the efficiency of disease diagnosis and extend the system to diagnose additional medical conditions. Les maladies fébriles tropicales représentent un défi majeur de santé publique dans les régions tropicales, en particulier dans les contextes à ressources limitées, où des diagnostics rapides et précis sont essentiels pour une prise en charge efficace des maladies. Cependant, les systèmes diagnostiques existants fonctionnent souvent comme des « boîtes noires » et manquent d’interprétabilité, ce qui rend difficile pour les professionnels de santé de comprendre et de faire confiance aux prédictions issues de l’apprentissage automatique (ML). De plus, les systèmes existants excluent les patients plus jeunes, ce qui limite leur applicabilité. Cette étude vise à développer un système diagnostique intégré améliorant l’interprétabilité en s’appuyant sur l’apprentissage automatique (ML), l’intelligence artificielle explicable (XAI) et un grand modèle de langage (LLM). Un ensemble de données comprenant 3 914 dossiers patients et 32 symptômes a été obtenu à partir d’un projet financé par le New Frontiers in Research Fund, puis prétraité pour l’analyse. Le modèle Random Forest (RF) a été entraîné avec un ajustement des hyperparamètres à l’aide de GridSearchCV et évalué par validation croisée à 5 plis afin d’optimiser ses performances. Le modèle ajusté a atteint des performances diagnostiques élevées, démontrant son efficacité dans le diagnostic de six maladies fébriles. Pour améliorer l’interprétabilité, un cadre d’interprétation du modèle (Model Interpretability Framework, MIF) a été intégré, combinant les explications locales indépendantes du modèle (LIME) pour des visualisations explicatives et ChatGPT pour des explications textuelles. Cette combinaison a permis aux utilisateurs de mieux comprendre le processus diagnostique, répondant ainsi aux limites des modèles ML de type boîte noire. Le système a été implémenté en Python dans un environnement de développement comprenant Google Colaboratory, Visual Studio Code, Flet et MySQL pour la gestion de la base de données. Une méthodologie de développement agile et des outils de modélisation UML ont été utilisés pour concevoir une interface conviviale destinée aux cliniciens et aux patients. Le système diagnostique a été évalué à l’aide des métriques précision, rappel, score F1 et AUC-ROC. Le modèle RF a atteint une précision remarquable pour la plupart des maladies, un rappel élevé (≥ 0,97) et une AUC-ROC de 0,99, indiquant des performances d’entraînement quasi parfaites avec très peu d’erreurs de classification. Sur l’ensemble de test, le modèle a montré de meilleures performances dans le diagnostic du paludisme (score F1 = 88 %, précision = 85 %), des infections urinaires (score F1 = 72 %, précision = 80 %) et des infections des voies respiratoires (score F1 = 72 %, précision = 77 %). Le système évalué a démontré de solides performances prédictives, identifiant correctement 72 cas sur 99 patients testés, avec 26 cas mal classés et un cas totalement non détecté. Il a obtenu les meilleurs taux de détection pour le paludisme et le VIH/SIDA, identifiant correctement tous les cas sans faux positifs. Ce travail améliore les solutions diagnostiques dans les contextes de santé tropicale en renforçant l’explicabilité et en assurant l’inclusion des patients plus jeunes, répondant ainsi aux principales limites des systèmes existants. L’intégration du ML, de la XAI et des LLM améliore les performances diagnostiques et pose les bases de futures innovations en santé basées sur l’intelligence artificielle, contribuant ainsi à améliorer les résultats de santé dans les régions à ressources limitées. Les prestataires de soins de santé sont encouragés à adopter ce système afin d’améliorer l’efficacité du diagnostic des maladies et à l’étendre pour inclure d’autres affections médicales.

Similaires