# π Ekegusii-LLM-Translation: Resource-Aware Adaptation of Multilingual Large Language Models for Low-Resource Machine Translation
Official open-source research repository for the ACL/EMNLP paper:
> **"Resource-Aware Adaptation of Multilingual Large Language Models for Low-Resource Machine Translation: A Case Study on Ekegusii"**
---
## π Research Objective & Central Question
Low-resource African language translation faces severe data scarcity and morphological complexity. This repository provides a **Resource-Aware Instruction-Tuning Translation Framework** that systematically evaluates how different linguistic data resources (monolingual, bilingual, trilingual, and dictionary lexicons) contribute to machine translation performance when instruction-tuning Large Language Models (**Qwen2.5 7B Instruct** and **NLB200**) on **Ekegusii (Bantu, eke)**, **Kiswahili (swh)**, and **English (eng)** on an **NVIDIA A100 80GB GPU**.
> **Central Research Question**: *How can multilingual LLMs be effectively adapted for high-quality translation between Ekegusii, Kiswahili, and English using limited multilingual resources?*
---
## π» Hardware Environment
- **GPU**: NVIDIA A100-SXM4-80GB (80 GB VRAM)
- **CPU**: 22 vCPU Cores
- **RAM**: 118 GB System Memory
- **OS**: Ubuntu 22.04 LTS / Linux 5.15
---
## π Master Corpus Statistics (0% Data Leakage Guarantee)
- **Master Sentence Corpus (`data/master_corpus/master_sentence_corpus.csv`)**: **49,277 multilingual concepts** (`concept_id`, `English`, `Kiswahili`, `Ekegusii`, `source`, `dataset_origin`).
- **Master Lexical Corpus (`data/master_corpus/master_lexical_corpus.csv`)**: **268 dictionary terms** (`lexicon_id`, `English`, `Kiswahili`, `Ekegusii`, `source`).
- **Master 80/10/10 Split**:
- **Train Split (`master_train.csv`)**: 39,421 concepts (80%)
- **Validation Split (`master_val.csv`)**: 4,928 concepts (10%)
- **Test Split (`master_test.csv`)**: 4,928 concepts (10%) β **0 overlapping concept IDs across splits**.
- β¦