Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

What are the limits of cross-lingual dense passage retrieval for low-resource languages?

Domaine:

natural language processing

Type de record:

paperdataset
Créateur:
Wu,RenVer
Hôte:avatar
In this paper, we analyze the capabilities of the multi-lingual Dense Passage Retriever (mDPR) for extremely low-resource languages. In the Cross-lingual Open-Retrieval Answer Generation (CORA) pipeline, mDPR achieves success on multilingual open QA benchmarks across 26 languages, of which 9 were unseen during training. These results are promising for Question Answering (QA) for low-resource languages. We focus on two extremely low-resource languages for which mDPR performs poorly: Amharic and Khmer. We collect and curate datasets to train mDPR models using Translation Language Modeling (TLM) and question--passage alignment. We also investigate the effect of our extension on the language distribution in the retrieval results. Our results on the MKQA and AmQA datasets show that language alignment brings improvements to mDPR for the low-resource languages, but the improvements are modest and the results remain low. We conclude that fulfilling CORA's promise to enable multilingual open QA in extremely low-resource settings is challenging because the model, the data, and the evaluation approach are intertwined. Hence, all three need attention in follow-up work. We release our code for reproducibility and future work: anonymous.4open.science

Visit

arxiv.org

Tasks

information retrievalquestion answering

Languages

Amharic

Tags

Information Retrieval

Similaires

Query Augmentation for Cross-Lingual Dense Retrieval in Low-Resource LanguagesQuery-Augmented vs. Passage-Augmented Cross-Lingual Dense Retrieval on Low-Resource MTrQASynthetic Query Augmentation for Zero-Shot Cross-Lingual Dense Retrieval in Low-Resource LanguagesCross-Lingual Query Generation Augmentation for Robust Dense Retrieval Against Adversarial Paraphrases in Low-Resource LanguagesParameter-Efficient Tuning vs. Full Fine-Tuning in Cross-Lingual Dense Retrieval for Low-Resource LanguagesCross-Lingual Retrieval Augmented Prompt for Low-Resource Languages

Query Augmentation for Cross-Lingual Dense Retrieval in Low-Resource Languages

Effective cross-lingual dense retrieval methods that rely on multilingual pre-trained language model

Query-Augmented vs. Passage-Augmented Cross-Lingual Dense Retrieval on Low-Resource MTrQA

Effective cross-lingual dense retrieval methods that rely on multilingual pre-trained language model

Synthetic Query Augmentation for Zero-Shot Cross-Lingual Dense Retrieval in Low-Resource Languages

Multilingual Pretrained Language Models (MPLMs) perform strongly in cross-lingual transfer. We propo

Cross-Lingual Query Generation Augmentation for Robust Dense Retrieval Against Adversarial Paraphrases in Low-Resource Languages

Effective cross-lingual dense retrieval methods that rely on multilingual pre-trained language model

Parameter-Efficient Tuning vs. Full Fine-Tuning in Cross-Lingual Dense Retrieval for Low-Resource Languages

Effective cross-lingual dense retrieval methods that rely on multilingual pre-trained language model

Cross-Lingual Retrieval Augmented Prompt for Low-Resource Languages

Multilingual Pretrained Language Models (MPLMs) have shown their strong multilinguality in recent em