Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

HaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa Language

Domaine:

natural language processing

Type de record:

paper

This paper presents HaVQA, the first multimodal dataset for visual question-answering (VQA) tasks in the Hausa language. The dataset was created by manually translating 6,022 English question-answer pairs, which are associated with 1,555 unique images from the Visual Genome dataset. As a result, the dataset provides 12,044 gold standard English-Hausa parallel sentences that were translated in a fashion that guarantees their semantic match with the corresponding visual information. We conducted several baseline experiments on the dataset, including visual question answering, visual question elicitation, text-only and multimodal machine translation.

Visit

arxiv.org

Tasks

image-text retrievalcomputer vision

Languages

Hausa

Tags

havqaquestion answering

Similaires

SwahiliVQA: A Dataset for Visual Question Answering in Swahili LanguageSwahili Visual Question Answering DatasetAVQANet: Amharic Visual Question Answering Dataset for Ethiopian Museum ArtifactsKenSwQuAD – A Question Answering Dataset for Swahili Low Resource LanguageQuestion-Answering in a Low-resourced Language: Benchmark Dataset and Models for TigrinyaSwahili Question-Answering Dataset for Horticulture

SwahiliVQA: A Dataset for Visual Question Answering in Swahili Language

Swahili Visual Question Answering Dataset

Swahili Language VQA Dataset

AVQANet: Amharic Visual Question Answering Dataset for Ethiopian Museum Artifacts

This dataset was developed for research on Amharic Visual Question Answering (AVQA) systems for Ethi

KenSwQuAD – A Question Answering Dataset for Swahili Low Resource Language

This research developed a Kencorpus Swahili Question Answering Dataset KenSwQuAD from raw data of Swahili language, which is a low resource language predominantly spoken in Eastern African and also has speakers in other parts of the world. Question Answering datase

Question-Answering in a Low-resourced Language: Benchmark Dataset and Models for Tigrinya

Question-Answering (QA) has seen significant advances recently, achieving near human-level performan

Swahili Question-Answering Dataset for Horticulture

The dataset was created to contribute to Swahili language resources for natural language processing