Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Zero-Shot Morphological Discovery in Low-Resource Bantu Languages via Cross-Lingual Transfer and Unsupervised Clustering

Domaine:

natural language processing

Type de record:

papersoftwaredataset
Créateur:
MutMug
Hôte:avatar
We present a method for discovering morphological features in low-resource Bantu languages by combining cross-lingual transfer learning with unsupervised clustering. Applied to Giriama (nyf), a language with only 91 labeled paradigms, our pipeline discovers noun class assignments for 2,455 words and identifies two previously undocumented morphological patterns: an a- prefix variant for Class 2 (vowel coalescence - the merger of two adjacent vowels - of wa-, 95.1% consistency) and a contracted k'- prefix (98.5% consistency). External validation on 444 known Giriama verb paradigms confirms 78.2% lemmatization accuracy, while a v3 corpus expansion to 19,624 words (9,014 unique lemmas) achieves 97.3% segmentation and 86.7% lemmatization rates across all major word classes. Our ensemble of transfer learning from Swahili and unsupervised clustering, combined via weighted voting, exploits complementary strengths: transfer excels at cognate detection (leveraging ~60% vocabulary overlap) while clustering discovers language-specific innovations invisible to transfer. We release all code and discovered lexicons to support morphological documentation for low-resource Bantu languages.

Visit

arxiv.org

Languages

KigiryamaSwahili

Tags

Machine LearningComputation and Language

Similaires

Zero-Shot Cross-Lingual Transfer Dynamics in Low-Resource Languages via Intermediate Task ComplexityRobustness of Zero-Shot Cross-Lingual Transfer in Low-Resource Languages via Multilingual Intermediate-Task TrainingIntermediate-Task Training and Zero-Shot Cross-Lingual Transfer in Low-Resource LanguagesZero-Shot Cross-Lingual Transfer on XTREME via Intermediate-Task Training in Low-Resource Languages versus EnglishXLM-R Performance in Zero-Shot Cross-Lingual Transfer via Low-Resource Language TasksRobustness in Zero-Shot Cross-Lingual Transfer via Intermediate-Task Training for Low-Resource Languages in XTREME-R

Zero-Shot Cross-Lingual Transfer Dynamics in Low-Resource Languages via Intermediate Task Complexity

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuni

Robustness of Zero-Shot Cross-Lingual Transfer in Low-Resource Languages via Multilingual Intermediate-Task Training

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuni

Intermediate-Task Training and Zero-Shot Cross-Lingual Transfer in Low-Resource Languages

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuni

Zero-Shot Cross-Lingual Transfer on XTREME via Intermediate-Task Training in Low-Resource Languages versus English

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuni

XLM-R Performance in Zero-Shot Cross-Lingual Transfer via Low-Resource Language Tasks

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before

Robustness in Zero-Shot Cross-Lingual Transfer via Intermediate-Task Training for Low-Resource Languages in XTREME-R

Pre-trained multilingual language encoders, such as multilingual BERT and XLM-R, show great potentia