Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Data-Driven Modeling for Infectious Disease Prediction: Navigating Irregularities in Resource-Limited Settings

Domaine:

healthcare

Type de record:

paper
Créateur:
Mka
Éditeur:
UMa
Hôte:avatar
Infectious diseases continue to impose heavy burdens in low- and middle-income countries, where prediction and response are hindered by scarce, irregular data. Clinical and surveillance datasets in these settings are typically small, incomplete, imbalanced, and uncertain—conditions that challenge conventional machine learning models. Yet it is precisely under such imperfect circumstances that predictive modeling can save lives. This dissertation advances a data-diagnostic-first framework for infectious disease prediction that systematically addresses three pervasive data irregularities—class imbalance, missingness, and uncertainty—through methodological innovation and empirical validation. First, I introduce SMARTSMOTE (Structure- and Manifold-Aware Technique for Synthetic Minority Oversampling), a resampling method developed after evaluating deficiencies in existing techniques that distort data geometry or amplify noise. By preserving manifold structure and local variance, SMARTSMOTE improves minority recall and interpretability for rare infections such as Borrelia and Lassa fever. Next, I present MICE-GAIN, a hybrid imputation approach combining multiple chained equations and generative adversarial inference to recover missing clinical variables in resource-limited datasets. Sensitivity analyses on Lassa fever data reveal that imputation choice substantially influences downstream reliability and calibration, highlighting the importance of aligning data recovery with model interpretability. Finally, I incorporate Bayesian and variance-based modeling to quantify aleatoric and epistemic uncertainty, revealing how preprocessing reshapes predictive confidence. Together, these components form an irregularity-aware modeling pipeline validated across pathogen datasets in Senegal, Nigeria, and the United States. The framework enhances predictive accuracy, calibration, and interpretability under data scarcity, advancing a paradigm that treats data irregularities not as obstacles but as diagnostic signals for building equitable and trustworthy AI in global health.

Visit

doi.orgrepository.escholarship.umassmed.edu