Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

EgMM-Corpus: A Multimodal Vision-Language Dataset for Egyptian Culture

Domaine:

natural language processing

Type de record:

paperdataset
Créateur:
GamElsLilGad
Hôte:avatar
Despite recent advances in AI, multimodal culturally diverse datasets are still limited, particularly for regions in the Middle East and Africa. In this paper, we introduce EgMM-Corpus, a multimodal dataset dedicated to Egyptian culture. By designing and running a new data collection pipeline, we collected over 3,000 images, covering 313 concepts across landmarks, food, and folklore. Each entry in the dataset is manually validated for cultural authenticity and multimodal coherence. EgMM-Corpus aims to provide a reliable resource for evaluating and training vision-language models in an Egyptian cultural context. We further evaluate the zero-shot performance of Contrastive Language-Image Pre-training CLIP on EgMM-Corpus, on which it achieves 21.2% Top-1 accuracy and 36.4% Top-5 accuracy in classification. These results underscore the existing cultural bias in large-scale vision-language models and demonstrate the importance of EgMM-Corpus as a benchmark for developing culturally aware models.

Visit

arxiv.org

Tags

Computation and Language

Similaires

A Multilingual & Multimodal Text and Image Corpus Dataset for Political MisinformationThe Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African LanguagesMultimodal Sarcasm Dataset Generation for a Low-Resource Language: SwahiliMultimodal Computer Vision and Acoustic Bird Detection Dataset for Smart Rice Farming EnvironmentsHaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa LanguageA Vision-Based Deep Learning Framework for Egyptian Sign Language Recognition Using CNN and VGG-16

A Multilingual & Multimodal Text and Image Corpus Dataset for Political Misinformation

Our database is a richly annotated multimodal database designed to facilitate strong fake-news detec

The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages

We present the Thiomi Dataset, a large-scale multimodal corpus spanning ten African languages across

Multimodal Sarcasm Dataset Generation for a Low-Resource Language: Swahili

Multimodal Computer Vision and Acoustic Bird Detection Dataset for Smart Rice Farming Environments

This dataset was developed as part of the Birds’ Detector and Repellent System for Large-Scale Smart

HaVQA: A Dataset for Visual Question Answering and Multimodal Research in Hausa Language

This paper presents HaVQA, the first multimodal dataset for visual question-answering (VQA) tasks in the Hausa language. The dataset was created by manually translating 6,022 English question-answer pairs, which are associated with 1,555 unique images from the V

A Vision-Based Deep Learning Framework for Egyptian Sign Language Recognition Using CNN and VGG-16