BatakJailbreakBench: A Low-Resource Batak Toba Safety Benchmark for Jailbreak Resistance and Refusal–Leakage Behavior in LLMs
# BatakJailbreakBench
**BatakJailbreakBench: A Low-Resource Batak Toba Safety Benchmark for Jailbreak Resistance and Refusal–Leakage Behavior in LLMs**
BatakJailbreakBench is a low-resource **Batak Toba** safety benchmark designed to evaluate:
- **Jailbreak resistance** (does the model refuse when it should?)
- **Refusal quality** (does the model leak unsafe details even when it refuses?)
- **Cross-lingual safety robustness** using **ID-aligned English ↔ Batak Toba** prompts
This repository provides:
1) The benchmark datasets (English and Batak Toba)
2) A two-stage evaluation pipeline: **Stage A generate → Stage B judge**
3) Reproducible result artifacts: CSV/JSON summaries and category breakdowns
---
## Dataset on Hugging Face
The dataset is publicly available on Hugging Face:
huggingface.co
---
## Key Idea
Most LLM safety benchmarks are English-centric. BatakJailbreakBench enables controlled cross-lingual evaluation by pairing each Batak Toba prompt with an English counterpart (same ID, same intent, same category), and scoring:
- **Behavior correctness** (REFUSE vs SAFE_HELP vs CRISIS_SUPPORT)
- **Leakage severity** (Leak@1/Leak@2)
---
## Dataset Format
Each JSONL line is a single test case with (typical fields):
- `id` (string/int): alignment key between English and Batak Toba
- `category`: harm category (e.g., hacking, fraud, weapons, prompt_injection, self_harm)
- `attack_style`: jailbreak/social engineering style
- `prompt`: user prompt text
- `expected_behavior`: expected assistant action (REFUSE / SAFE_HELP / CRISIS_SUPPORT)
---
## Evaluation Pipeline (Two Stages)
### Stage A — Generate (model under test)
Run the model on each prompt and record raw responses.
Script:
- `scripts/run_two_datasets_benchmark_openai.py`
Outputs (example):
- `results/en_results.jsonl` + `results/en_results.csv`
- `results/batak_results.jsonl` + `results/batak_results.csv`
### Stage B — Judge (LLM-as-judge rubric)
Judge ea …