Abstract Background The extraction of valuable insights from malaria routine surveillance data is highly dependent on the processes and tools used to collect, curate, store, analyse, and disseminate that data and the essential information obtained from it. The main challenge is to ensure good quality of data collected at the local level. In this work, we have proposed a new framework for Data Quality Assessment designed for DHIS2 using Machine Learning techniques. Methodology The data used in this study was extracted from the DHIS2 Platform for 8 districts of Mopti in Mali for 2016 and 2017. We carried out three data preprocessing tasks. We developed four models based on machine learning algorithms for local and global outlier detection, trained and validated on malaria surveillance routine data extracted from DHIS2. We used five main evaluation metrics to assess the performance of the developed models. The proposed framework's design will consider the steps of Report-Accuracy Assessment and Cross-Checks presented in the Malaria Routine Data Quality Assessment Tool (MRDQA Tool). Results For the case of random errors (outliers), we found that all four models did not reach an AUC value of 60%. Despite the low value of the AUC metric, the precision scores reached values more than 90%. As the AUC metric represents the overall performance of the models, we can say that random errors do not leave enough patterns in the malaria routine surveillance data to be detected. In contrast, detecting systematic errors has good value for performance metrics (87% AUC and 98% precision. This is the case for systematic errors with the same structures (same consecutive months and same columns) in two different districts and systematic errors with different structures at the same time period in two differents districts. Conclusion The machine learning models integrated into the proposed framework perform well in detecting random and systematic errors (global or local outliers) in the malaria routine surveillance data. Only consistent and accurate data will be stored in the DHIS system with the proposed framework. This will maximise the potential to extract actionable knowledge from malaria routine surveillance data to make better informed-decision. خلفية مجردة يعتمد استخراج الرؤى القيمة من بيانات الترصد الروتيني للملاريا بشكل كبير على العمليات والأدوات المستخدمة لجمع تلك البيانات والمعلومات الأساسية التي تم الحصول عليها منها وتنظيمها وتخزينها وتحليلها ونشرها. ويتمثل التحدي الرئيسي في ضمان جودة البيانات التي يتم جمعها على المستوى المحلي. في هذا العمل، اقترحنا إطارًا جديدًا لتقييم جودة البيانات مصممًا لـ DHIS2 باستخدام تقنيات التعلم الآلي. المنهجية تم استخراج البيانات المستخدمة في هذه الدراسة من منصة DHIS2 لـ 8 مقاطعات في موبتي في مالي لعامي 2016 و 2017. نفذنا ثلاث مهام للمعالجة المسبقة للبيانات. لقد طورنا أربعة نماذج تعتمد على خوارزميات التعلم الآلي للكشف عن العوامل الخارجية المحلية والعالمية، وتم تدريبها والتحقق من صحتها على البيانات الروتينية لمراقبة الملاريا المستخرجة من DHIS2. استخدمنا خمسة مقاييس تقييم رئيسية لتقييم أداء النماذج المطورة. سينظر تصميم الإطار المقترح في خطوات تقييم دقة التقارير والفحوصات المتقاطعة المقدمة في أداة تقييم جودة البيانات الروتينية للملاريا (أداة MRDQA). النتائج بالنسبة لحالة الأخطاء العشوائية (القيم المتطرفة)، وجدنا أن جميع النماذج الأربعة لم تصل إلى قيمة الجامعة الأمريكية بالقاهرة بنسبة 60 ٪. على الرغم من القيمة المنخفضة لمقياس الجامعة الأمريكية بالقاهرة، وصلت درجات الدقة إلى قيم أكثر من 90 ٪. نظرًا لأن مقياس الجامعة الأمريكية بالقاهرة يمثل الأداء العام للنماذج، يمكننا القول إن الأخطاء العشوائية لا تترك أنماطًا كافية في بيانات المراقبة الروتينية للملاريا ليتم اكتشافها. في المقابل، فإن اكتشاف الأخطاء المنهجية له قيمة جيدة لمقاييس الأداء (87 ٪ من المساحة تحت المنحنى و 98 ٪ من الدقة. هذا هو الحال بالنسبة للأخطاء المنهجية مع نفس الهياكل (نفس الأشهر المتتالية ونفس الأعمدة) في منطقتين مختلفتين والأخطاء المنهجية مع هياكل مختلفة في نفس الفترة الزمنية في منطقتين مختلفتين. الاستنتاج تؤدي نماذج التعلم الآلي المدمجة في الإطار المقترح أداءً جيدًا في اكتشاف الأخطاء العشوائية والمنهجية (القيم المتطرفة العالمية أو المحلية) في بيانات المراقبة الروتينية للملاريا. سيتم تخزين البيانات المتسقة والدقيقة فقط في نظام DHIS مع الإطار المقترح. وسيؤدي ذلك إلى تعظيم إمكانية استخراج المعرفة القابلة للتنفيذ من بيانات الترصد الروتيني للملاريا لاتخاذ قرار مستنير بشكل أفضل. Résumé Contexte L'extraction d'informations précieuses à partir des données de surveillance de routine du paludisme dépend fortement des processus et des outils utilisés pour collecter, organiser, stocker, analyser et diffuser ces données et les informations essentielles qui en découlent. Le principal défi est d'assurer la bonne qualité des données collectées au niveau local. Dans ce travail, nous avons proposé un nouveau cadre d'évaluation de la qualité des données conçu pour DHIS2 à l'aide de techniques d'apprentissage automatique. Méthodologie Les données utilisées dans cette étude ont été extraites de la plateforme DHIS2 pour 8 districts de Mopti au Mali pour 2016 et 2017. Nous avons effectué trois tâches de prétraitement des données. Nous avons développé quatre modèles basés sur des algorithmes d'apprentissage automatique pour la détection locale et mondiale des valeurs aberrantes, formés et validés sur les données de routine de surveillance du paludisme extraites du DHIS2. Nous avons utilisé cinq mesures d'évaluation principales pour évaluer la performance des modèles développés. La conception du cadre proposé tiendra compte des étapes de l'évaluation de l'exactitude des rapports et des vérifications croisées présentées dans l'outil d'évaluation de la qualité des données de routine sur le paludisme (outil MRDQA). Résultats Pour le cas des erreurs aléatoires (valeurs aberrantes), nous avons constaté que les quatre modèles n'atteignaient pas une valeur de l'ASC de 60 %. Malgré la faible valeur de la mesure de l'ASC, les scores de précision ont atteint des valeurs supérieures à 90 %. Comme la mesure de l'ASC représente la performance globale des modèles, nous pouvons dire que les erreurs aléatoires ne laissent pas suffisamment de modèles dans les données de surveillance de routine du paludisme pour être détectées. En revanche, la détection des erreurs systématiques a une bonne valeur pour les mesures de performance (87 % d'ASC et 98 % de précision. C'est le cas des erreurs systématiques avec les mêmes structures (mêmes mois consécutifs et mêmes colonnes) dans deux districts différents et des erreurs systématiques avec des structures différentes à la même période dans deux districts différents. Conclusion Les modèles d'apprentissage automatique intégrés dans le cadre proposé fonctionnent bien pour détecter les erreurs aléatoires et systématiques (valeurs aberrantes mondiales ou locales) dans les données de surveillance de routine du paludisme. Seules les données cohérentes et précises seront stockées dans le système DHIS avec le cadre proposé. Cela maximisera le potentiel d'extraction de connaissances exploitables à partir des données de surveillance de routine du paludisme pour prendre une décision mieux éclairée. Antecedentes abstractos La extracción de información valiosa a partir de los datos de vigilancia rutinaria de la malaria depende en gran medida de los procesos y herramientas utilizados para recopilar, curar, almacenar, analizar y difundir esos datos y la información esencial obtenida de ellos. El principal desafío es garantizar la buena calidad de los datos recopilados a nivel local. En este trabajo, hemos propuesto un nuevo marco para la evaluación de la calidad de los datos diseñado para DHIS2 utilizando técnicas de aprendizaje automático. Metodología Los datos utilizados en este estudio se extrajeron de la Plataforma DHIS2 para 8 distritos de Mopti en Malí para 2016 y 2017. Realizamos tres tareas de preprocesamiento de datos. Desarrollamos cuatro modelos basados en algoritmos de aprendizaje automático para la detección de valores atípicos locales y globales, entrenados y validados con datos de rutina de vigilancia de la malaria extraídos de DHIS2. Utilizamos cinco métricas de evaluación principales para evaluar el rendimiento de los modelos desarrollados. El diseño del marco propuesto considerará los pasos de Evaluación de Precisión de Informes y Verificaciones Cruzadas presentados en la Herramienta de Evaluación de Calidad de Datos de Rutina de Malaria (Herramienta MRDQA). Resultados Para el caso de errores aleatorios (valores atípicos), encontramos que los cuatro modelos no alcanzaron un valor de AUC del 60%. A pesar del bajo valor de la métrica AUC, las puntuaciones de precisión alcanzaron valores superiores al 90%. Como la métrica AUC representa el rendimiento general de los modelos, podemos decir que los errores aleatorios no dejan suficientes patrones en los datos de vigilancia de rutina de la malaria para ser detectados. Por el contrario, la detección de errores sistemáticos tiene un buen valor para las métricas de rendimiento (87% AUC y 98% de precisión. Este es el caso de errores sistemáticos con las mismas estructuras (mismos meses consecutivos y mismas columnas) en dos distritos diferentes y errores sistemáticos con diferentes estructuras en el mismo período de tiempo en dos distritos diferentes. Conclusión Los modelos de aprendizaje automático integrados en el marco propuesto funcionan bien para detectar errores aleatorios y sistemáticos (valores atípicos globales o locales) en los datos de vigilancia de rutina de la malaria. Solo se almacenarán datos consistentes y precisos en el sistema DHIS con el marco propuesto. Esto maximizará el potencial para extraer conocimiento procesable de los datos de vigilancia de rutina de la malaria para tomar decisiones mejor informadas.