# Clustering African Countries into Mortality Risk Tiers (2020)
## Overview
This project applies unsupervised machine learning techniques to classify African countries into distinct mortality risk tiers based on key health indicators from 2020. The analysis aims to inform public health resource allocation and intervention prioritization.
## Research Question
**Can African countries be grouped into distinct mortality risk tiers in 2020 based on under-five mortality, maternal mortality, and life expectancy to inform public health resource allocation and intervention prioritization?**
## Dataset
- **Source:** `df_africa_cleaned.csv`
- **Year:** 2020
- **Scope:** Individual African countries (excluding regional aggregates)
### Key Health Indicators
| Indicator | Description |
|-----------|-------------|
| Life Expectancy | Life expectancy at birth for both sexes (years) |
| Maternal Mortality | Deaths per 100,000 population |
| Under-Five Mortality | Deaths per 1,000 live births |
## Methodology
### 1. Data Preparation
- Filtered data for 2020
- Removed regional aggregates
- Handled missing values
- Standardized features using Z-score normalization
### 2. Clustering Algorithms
- **K-Means Clustering**
- **Hierarchical Clustering** (Ward, Complete, Average linkage)
### 3. Optimal Cluster Selection
Evaluated using multiple metrics:
- Elbow Method (Inertia)
- Silhouette Score
- Calinski-Harabasz Index
- Davies-Bouldin Index
### 4. Visualization
- PCA for dimensionality reduction
- Dendrograms for hierarchical clustering
- Silhouette plots for cluster validation
## Project Structure
```
├── africa_health_clustering_analysis_2020.ipynb # Main analysis notebook
├── df_africa_cleaned.csv # Input dataset
├── africa_health_clusters_2020.csv # Output: Country classifications
└── README.md # Project documentation
```
## Requirements
```
pandas
numpy
matplotlib
seaborn
scikit-learn
scipy
``` …