Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Désentrelacement Fréquentiel Doux pour les Codecs Audio Neuronaux

Domaine:

natural language processing

Type de record:

paper
Créateur:
GinBieFerRic
Hôte:avatar
While neural-based models have led to significant advancements in audio feature extraction, the interpretability of the learned representations remains a critical challenge. To address this, disentanglement techniques have been integrated into discrete neural audio codecs to impose structure on the extracted tokens. However, these approaches often exhibit strong dependencies on specific datasets or task formulations. In this work, we propose a disentangled neural audio codec that leverages spectral decomposition of time-domain signals to enhance representation interpretability. Experimental evaluations demonstrate that our method surpasses a state-of-the-art baseline in both reconstruction fidelity and perceptual quality. in French language, Groupe de Recherche et d'Etudes du Traitement du Signal et des Images (GRETSI 2025), Aug 2025, Strasbourg, France

Visit

arxiv.org

Tasks

speech processing

Tags

SoundAudio and Speech ProcessingNeurons and Cognition

Similaires

Improving Speech Recognition for Under-resourced Languages Utilizing Audio-codecs for Data AugmentationUtiliser les Interjections pour détecter les émotions ib9barrry/Application-Mobile-pour-la-collecte-de-donnees-audioCoopérative numérique pour les études éthiopiennesInvestigation of Amazigh Speech Recognition Performance Based on G711 and GSM CodecsDes correcteurs orthographiques pour les langues africaines

Improving Speech Recognition for Under-resourced Languages Utilizing Audio-codecs for Data Augmentation

Presenter: Nirayo Hailu Gebreegziabher, Ingo Siegert, Andreas Nürnberger, MMSP 2020, Virtual Event,

Utiliser les Interjections pour détecter les émotions

National audience

ib9barrry/Application-Mobile-pour-la-collecte-de-donnees-audio

build wolof speech recognition system with deep learning # SOURCE CODE APPLICATION MOBILE REACT NAT

Coopérative numérique pour les études éthiopiennes

Notice descriptive d'un projet de recherche. La coopérative numérique pour les études

Investigation of Amazigh Speech Recognition Performance Based on G711 and GSM Codecs

Des correcteurs orthographiques pour les langues africaines

International audience Résumé Nous rappelons brièvement l'histoire récente des grande