Logo Lanfrica

aykahsay/Ekegusii-LLM-Translation

Domain:

natural language processing

Record type:

datasetpaper
Creator:
ayk
Host:
# 🌍 Ekegusii-LLM-Translation: Resource-Aware Adaptation of Multilingual Large Language Models for Low-Resource Machine Translation Official open-source research repository for the ACL/EMNLP paper: > **"Resource-Aware Adaptation of Multilingual Large Language Models for Low-Resource Machine Translation: A Case Study on Ekegusii"** --- ## πŸ“Œ Research Objective & Central Question Low-resource African language translation faces severe data scarcity and morphological complexity. This repository provides a **Resource-Aware Instruction-Tuning Translation Framework** that systematically evaluates how different linguistic data resources (monolingual, bilingual, trilingual, and dictionary lexicons) contribute to machine translation performance when instruction-tuning Large Language Models (**Qwen2.5 7B Instruct** and **NLB200**) on **Ekegusii (Bantu, eke)**, **Kiswahili (swh)**, and **English (eng)** on an **NVIDIA A100 80GB GPU**. > **Central Research Question**: *How can multilingual LLMs be effectively adapted for high-quality translation between Ekegusii, Kiswahili, and English using limited multilingual resources?* --- ## πŸ’» Hardware Environment - **GPU**: NVIDIA A100-SXM4-80GB (80 GB VRAM) - **CPU**: 22 vCPU Cores - **RAM**: 118 GB System Memory - **OS**: Ubuntu 22.04 LTS / Linux 5.15 --- ## πŸ“Š Master Corpus Statistics (0% Data Leakage Guarantee) - **Master Sentence Corpus (`data/master_corpus/master_sentence_corpus.csv`)**: **49,277 multilingual concepts** (`concept_id`, `English`, `Kiswahili`, `Ekegusii`, `source`, `dataset_origin`). - **Master Lexical Corpus (`data/master_corpus/master_lexical_corpus.csv`)**: **268 dictionary terms** (`lexicon_id`, `English`, `Kiswahili`, `Ekegusii`, `source`). - **Master 80/10/10 Split**: - **Train Split (`master_train.csv`)**: 39,421 concepts (80%) - **Validation Split (`master_val.csv`)**: 4,928 concepts (10%) - **Test Split (`master_test.csv`)**: 4,928 concepts (10%) β€” **0 overlapping concept IDs across splits**. - …