A 420-question benchmark evaluating LLM performance on Nigerian livestock
management knowledge, designed to investigate geographic and cultural bias
in large language models.
Most LLM benchmarks are Western-centric. This dataset targets a critical gap:
how well do frontier models perform on domain knowledge specific to
sub-Saharan African agricultural contexts?