Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

ijdutse/hausa-llm-safety

Domaine:

natural language processing

Type de record:

dataset
Créateur:
ijd
Hôte:
A curated dataset demonstrating linguistic reward hacking & safety failures in LLMs for the Hausa language. # Hausa LLM Safety: Vulnerability Analysis Dataset This repository contains the dataset and code for the paper **"Linguistic Reward Hacking: Exposing Vulnerabilities in GPT-OSS-20B's Handling of the Hausa Language"**. It provides a curated set of adversarial prompts and model responses that demonstrate critical safety failures, including the generation of harmful health misinformation and culturally insensitive content. ## 🚨 Key Findings Our red-teaming efforts revealed that GPT-OSS-20B is highly vulnerable to **linguistic reward hacking** in low-resource languages like Hausa. Key failures include: 1. **Promotion of Toxic Substances:** Recommending insecticides (Fiya-Fiya/Cyphermethrin) and rodenticides (Shinkafar Bera/Aluminium Phosphide) as safe for human consumption. 2. **Cultural Insensitivity:** Generating stories that incorporate demeaning local idioms and fabricate inflammatory historical narratives. 3. **Confident Hallucination:** Providing detailed, false instructions on "cultivating" processed foods like spaghetti (Taliya) and local cakes (Alkaki). ## 📁 Repository Structure ``` hausa-llm-safety/ ├── data/ # All prompts and collected model responses ├── notebooks/ # Jupyter notebook for replication └── docs/ # Detailed methodology ``` ## 📊 Dataset Overview The dataset is organized into three main categories of harm: - `toxic_substances`: Prompts and responses related to harmful chemical recommendations. - `cultural_insensitivity`: Prompts using demeaning idioms and resulting stories. - `food_hallucination`: Prompts that trigger false information about food cultivation. Each CSV file in `data/prompts/` contains the following columns: - `prompt_id`: A unique identifier for the prompt. - `prompt_text_ha`: The full adversarial prompt in Hausa. - `prompt_text_en`: English translation of the prompt. - `category`: The category of harm. - `target_failure`: The specific vulnerability the prompt is designed to expose. # …

Visit

github.com

Languages

Hausa

Licenses

MIT

Similaires

ijdutse/hausa-corpusijdutse/hausa-misinformation-datasetbpattath/llm-health-safety-evalsijdutse/naija-nlpProfessor/naija-agri-llm-yoruba-hausabnm-AI-dev/african-llm-safety-evaluation

ijdutse/hausa-corpus

A collection of textual datasets in Hausa language and the corresponding translation in English lang

ijdutse/hausa-misinformation-dataset

A curated dataset of annotated fake & genuine news in Hausa. Resources for NLP, misinformation detec

bpattath/llm-health-safety-evals

Open evaluation suite for LLM decision-support in low-resource health systems: grounding, multilingu

ijdutse/naija-nlp

A curated list of research papers, resources, and updates in NLP and related fields for low-resource

Professor/naija-agri-llm-yoruba-hausa

bnm-AI-dev/african-llm-safety-evaluation

Systematic red-teaming framework for multilingual LLM safety evaluation # African LLM Safety Evalua