Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries

Domaine:

natural language processing

Type de record:

paperdatasetmodel
Créateur:
LiuJinLi,Won
Hôte:avatar
Vision-language models (VLMs) have advanced human-AI interaction but struggle with cultural understanding, often misinterpreting symbols, gestures, and artifacts due to biases in predominantly Western-centric training data. In this paper, we construct CultureVerse, a large-scale multimodal benchmark covering 19, 682 cultural concepts, 188 countries/regions, 15 cultural concepts, and 3 question types, with the aim of characterizing and improving VLMs' multicultural understanding capabilities. Then, we propose CultureVLM, a series of VLMs fine-tuned on our dataset to achieve significant performance improvement in cultural understanding. Our evaluation of 16 models reveals significant disparities, with a stronger performance in Western concepts and weaker results in African and Asian contexts. Fine-tuning on our CultureVerse enhances cultural perception, demonstrating cross-cultural, cross-continent, and cross-dataset generalization without sacrificing performance on models' general VLM benchmarks. We further present insights on cultural generalization and forgetting. We hope that this work could lay the foundation for more equitable and culturally aware multimodal AI systems. Technical report; 26 pages

Visit

arxiv.org

Tasks

computer visionimage-text retrieval

Tags

Artificial IntelligenceComputation and LanguageComputer Vision and Pattern Recognition

Similaires

Benchmarking Vision Language Models for Cultural UnderstandingEnhanced Arabic Document Understanding Using Vision-Language ModelsTDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language ModelsMaRVL: Multicultural Reasoning over Vision and LanguageImproving language models for underserved languages and communitiesAgro-Consensus: Semantic Self-Consistency in Vision-Language Models for Crop Disease Management in Developing Countries

Benchmarking Vision Language Models for Cultural Understanding

Foundation models and vision-language pre-training have notably advanced Vision Language Models (VLM

Enhanced Arabic Document Understanding Using Vision-Language Models

TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models

Top-down images play an important role in safety-critical settings such as autonomous navigation and

MaRVL: Multicultural Reasoning over Vision and Language

Multicultural Reasoning over Vision and <

Improving language models for underserved languages and communities

Les technologies d’intelligence artificielle (IA), principalement propulsées par les grands modèles

Agro-Consensus: Semantic Self-Consistency in Vision-Language Models for Crop Disease Management in Developing Countries

Agricultural disease management in developing countries such as India, Kenya, and Nigeria faces sign