# Multilabel Emotion Analysis for African Languages
**Transfer Learning + Data Augmentation on BRIGHTER & EthioEmo**
**Authors:** Nicholas Dobson, Simon van der Merwe, Naazneen Khan
**Course:** Natural Language Processing COS 760 – University of Pretoria (2026)
---
## Overview
Natural Language Processing has largely focused on high-resource languages, leaving African languages underrepresented despite their vast diversity.
This project tackles **multilabel emotion classification** for African languages using:
- **BRIGHTER dataset** (28 languages)
- **EthioEmo dataset** (4 Ethiopian languages)
We explore how to improve performance in **low-resource settings** through:
- Transfer learning (multilingual transformers)
- Data augmentation (back-translation & paraphrasing)
- Explainability (attention visualization)
---
## Objectives
- Build strong baselines for African language emotion classification
- Evaluate augmentation techniques for low-resource data
- Analyse model behaviour using attention mechanisms
---
## Research Questions
- **RQ1:** Which model performs best? (mBERT vs XLM-R vs AfroXLMR)
- **RQ2:** How does data augmentation impact performance?
- **RQ3:** What linguistic patterns do models learn across languages?
---
## Datasets
- **BRIGHTER**: ~100k samples, 28 languages
- **EthioEmo**: 23k samples, 4 languages
- Optional: **AfriSenti** (auxiliary sentiment data)
### Emotion Labels (Multilabel)
- Anger
- Fear
- Surprise
- Sadness
- Happiness
- Disgust
---
## Methodology
### 1. Baseline Models
We fine-tune:
- mBERT
- XLM-RoBERTa
- AfroXLMR
**Setup:**
- Loss: Binary Cross-Entropy (weighted)
- LR: 2e-5
- Batch size: 16
- Epochs: 5 (early stopping on F1)
---
### 2. Data Augmentation
- **Back-translation** (via MarianMT / Google Translate)
- **Paraphrasing** (multilingual T5)
**Filtering:**
- Cosine similarity > 0.85 (semantic consistency)
---
### 3. Explainability
- Attention visualization using **BERTViz**
- Cross-lingual comparison of token …