Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Discrete Audio Tokens Enhance Cross-Lingual Speech Recognition in Low-Resource Languages

Domaine:

natural language processing

Type de record:

paper
Créateur:
Ass
Éditeur:
Zenodo
Hôte:avatar
This report synthesises findings from 13 peer-reviewed papers addressing the following research question: Do discrete audio tokens improve cross-lingual speech recognition accuracy compared to mel-spectrograms when fine-tuning large pre-trained models on low-resource languages. 9 claims were extracted from source literature; 9 were independently verified against retrieved documents. An automated multi-reviewer quality assessment produced a score of 8.7/10. This report is a machine-generated literature synthesis and does not constitute original research. Research goal: Do discrete audio tokens improve cross-lingual speech recognition accuracy compared to mel-spectrograms when fine-tuning large pre-trained models on low-resource languages? Autonomous literature synthesis. Automated review score: 8.7/10. Full text and citation available at Assignee Research. Machine-generated literature synthesis. Content is derived from peer-reviewed papers; see individual sources for authoritative data. Automated review score: 8.7/10. Published by Assignee Research (assignee.net).

Visit

doi.orgzenodo.org

Tasks

automatic speech recognitionspeech processing

Tags

discreteaudiotokensimprovecross-lingualspeechrecognitionaccuracy

Licenses

Creative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similaires

Exploiting Adapters for Cross-lingual Low-resource Speech RecognitionDonorRank: Donor Language Selection for Low-Resource Cross-Lingual Speech RecognitionDiscrete vs Continuous Audio Token Representations in Cross-Lingual Transfer Accuracy on CommonVoice Low-Resource BenchmarkCross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech RecognitionPredicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokensNamed Entity Recognition in Low-resource Languages using Cross-lingual distributional word representation

Exploiting Adapters for Cross-lingual Low-resource Speech Recognition

Cross-lingual speech adaptation aims to solve the problem of leveraging multiple rich-resource langu

DonorRank: Donor Language Selection for Low-Resource Cross-Lingual Speech Recognition

Low-resource automatic speech recognition (ASR) commonly relies on cross-lingual transfer, where mod

Discrete vs Continuous Audio Token Representations in Cross-Lingual Transfer Accuracy on CommonVoice Low-Resource Benchmark

This paper presents XLSR which learns cross-lingual speech representations by pretraining a single m

Cross-lingual Embedding Clustering for Hierarchical Softmax in Low-Resource Multilingual Speech Recognition

We present a novel approach centered on the decoding stage of Automatic Speech Recognition (ASR) tha

Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens

While massively multilingual speech models like wav2vec 2.0 XLSR-128 can be directly fine-tuned for

Named Entity Recognition in Low-resource Languages using Cross-lingual distributional word representation

Named Entity Recognition (NER) is a fundamental task in many NLP applications that seek to identify