Logo Lanfrica

lamhotsiagian/batak-safety-benchmark

Domaine:

natural language processing

Type de record:

dataset
Créateur:
lam
Hôte:
BatakJailbreakBench: A Low-Resource Batak Toba Safety Benchmark for Jailbreak Resistance and Refusal–Leakage Behavior in LLMs # BatakJailbreakBench **BatakJailbreakBench: A Low-Resource Batak Toba Safety Benchmark for Jailbreak Resistance and Refusal–Leakage Behavior in LLMs** BatakJailbreakBench is a low-resource **Batak Toba** safety benchmark designed to evaluate: - **Jailbreak resistance** (does the model refuse when it should?) - **Refusal quality** (does the model leak unsafe details even when it refuses?) - **Cross-lingual safety robustness** using **ID-aligned English ↔ Batak Toba** prompts This repository provides: 1) The benchmark datasets (English and Batak Toba) 2) A two-stage evaluation pipeline: **Stage A generate → Stage B judge** 3) Reproducible result artifacts: CSV/JSON summaries and category breakdowns --- ## Dataset on Hugging Face The dataset is publicly available on Hugging Face: huggingface.co --- ## Key Idea Most LLM safety benchmarks are English-centric. BatakJailbreakBench enables controlled cross-lingual evaluation by pairing each Batak Toba prompt with an English counterpart (same ID, same intent, same category), and scoring: - **Behavior correctness** (REFUSE vs SAFE_HELP vs CRISIS_SUPPORT) - **Leakage severity** (Leak@1/Leak@2) --- ## Dataset Format Each JSONL line is a single test case with (typical fields): - `id` (string/int): alignment key between English and Batak Toba - `category`: harm category (e.g., hacking, fraud, weapons, prompt_injection, self_harm) - `attack_style`: jailbreak/social engineering style - `prompt`: user prompt text - `expected_behavior`: expected assistant action (REFUSE / SAFE_HELP / CRISIS_SUPPORT) --- ## Evaluation Pipeline (Two Stages) ### Stage A — Generate (model under test) Run the model on each prompt and record raw responses. Script: - `scripts/run_two_datasets_benchmark_openai.py` Outputs (example): - `results/en_results.jsonl` + `results/en_results.csv` - `results/batak_results.jsonl` + `results/batak_results.csv` ### Stage B — Judge (LLM-as-judge rubric) Judge ea …

Languages