un pipeline complet d’analyse de la pollution atmosphérique à Douala (Cameroun) en utilisant des données réelles ou synthétiques, avec des méthodes statistiques et de machine learning. Voici la stratégie détaillée pour répondre aux objectifs et produire les livrables.
# Projet : Analyse de la Qualité de l'Air à Douala (Cameroun)
---
## Contexte
Douala, capitale économique du Cameroun, connaît une croissance urbaine rapide et une activité industrielle intense. Cette situation génère une pollution atmosphérique qui impacte la santé des populations. Des capteurs mesurent en continu plusieurs polluants (PM2.5, PM10, NO₂, O₃, CO) ainsi que des variables météorologiques (température, humidité, vitesse du vent).
L'objectif de ce projet est de construire un **pipeline d'analyse complet** pour :
- Comprendre les **patterns temporels** de la pollution,
- Identifier les **périodes et zones** les plus critiques,
- **Prédire les pics de pollution** à partir des conditions météorologiques,
- Proposer des **recommandations** aux autorités locales.
---
## Questions à traiter
1. **Q1** : Quels polluants sont les plus élevés et à quelles heures de la journée ?
2. **Q2** : Existe-t-il une **saisonnalité** dans les niveaux de pollution ?
3. **Q3** : Peut-on **prédire** un pic de pollution à partir des conditions météorologiques ?
4. **Q4** : Quels quartiers ou zones sont les plus exposés ?
---
## Données
## Sources envisagées
- **OpenAQ API** (données réelles) : openaq.org
- **WHO Air Quality Database** : données historiques mondiales
- **Génération synthétique** (faute de données locales suffisantes)
Pour ce projet, nous utilisons un **jeu de données synthétique réaliste** généré avec `numpy` et `pandas`, respectant les tendances saisonnières et journalières observées à Douala (saison sèche plus polluée, heures de pointe matin/soir, corrélations entre polluants). Le fichier généré est `douala_air_quality.csv` (8 784 enregistrements horaires sur l'année 2024).
---
## Outils utilisés
| Bibliothèque / Outil | Rôle |
|---------------------|------|
| `pandas`, `numpy` | Manipulation et calcul numérique |
| `matplotlib`, `seaborn` | Visualisations |
| `scikit-learn` | Standardisation, ACP, clustering K‑Means, Random Forest |
| `s …