Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Adapting Where It Matters: Depth-Aware Adaptation for Efficient Multilingual Speech Recognition in Low-Resource Languages

Domaine:

natural language processing

Type de record:

paper
Créateur:
Xiao YangHolDan
Hôte:avatar
Recent speech foundation models excel at multilingual automatic speech recognition (ASR) for high-resource languages, but adapting them to low-resource languages remains challenging due to data scarcity and efficiency constraints. Full-model fine-tuning is computationally expensive and prone to overfitting, while parameter-efficient methods like LoRA apply adaptation uniformly across layers, overlooking internal representations thus compromising effectiveness and efficiency. We analyze multilingual ASR models and reveal a U-shaped adaptability pattern: early and late layers are language-specific and require more adaptation, while intermediate layers retain shared semantics and need less. Building on this observation, we propose DAMA, a Depth-Aware Model Adaptation framework that allocates adaptation capacity according to each layer's role. DAMA also introduces Singular Value Decomposition (SVD)-based initialization to constrain adaptation and preserve the U-shaped pattern, as well as a frozen middle-layer basis for further efficiency. Evaluated on 18 low-resource languages across two benchmark datasets, DAMA matches or surpasses state-of-the-art accuracy with 80% fewer trainable parameters, achieves a 29% error reduction under extreme data scarcity, and significantly improves memory, training time, and computational efficiency over baselines. These results highlight the benefits of structure-aware adaptation for efficient, scalable multilingual ASR. 13 pages

Visit

arxiv.org

Tasks

automatic speech recognitionspeech processingtransfer learning

Tags

Audio and Speech ProcessingComputation and LanguageSound

Similaires

Robust speech recognition for low-resource languagesAdversarial Meta Sampling for Multilingual Low-Resource Speech RecognitionAdaptive Activation Network For Low Resource Multilingual Speech RecognitionDEFI-COLaF/Speech-Recognition-for-Low-Resource-LanguagesEnhancing Automatic Speech Recognition for Child Speech in Low-Resource LanguagesRethinking what Matters: Effective and Robust Multilingual Realignment for Low-Resource Languages

Robust speech recognition for low-resource languages

Process of human-machine interaction is an integral part of everyday human life in a modern world. T

Adversarial Meta Sampling for Multilingual Low-Resource Speech Recognition

Low-resource automatic speech recognition (ASR) is challenging, as the low-resource target language

Adaptive Activation Network For Low Resource Multilingual Speech Recognition

Low resource automatic speech recognition (ASR) is a useful but thorny task, since deep learning ASR

DEFI-COLaF/Speech-Recognition-for-Low-Resource-Languages

# Speech-Recognition-for-Low-Resource-Languages This repository contains code to fine-tune Whisper

Enhancing Automatic Speech Recognition for Child Speech in Low-Resource Languages

Automatic speech recognition (ASR) for children is demanding because their speech differs c

Rethinking what Matters: Effective and Robust Multilingual Realignment for Low-Resource Languages

Realignment is a promising strategy to improve cross-lingual transfer in multilingual language model