Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

A Multi-Faceted Framework for Personalizing Automatic Speech Recognition for Impaired Speech: Combining Bayesian Adaptation and Semantic Data Synthesis

Domain:

natural language processing

Record type:

paper
Creator:
Pok
Editor:
ETHETH
Publisher:
ETH
Host:avatar
Automatic Speech Recognition (ASR) systems consistently fail for individuals with non-normative speech due to data scarcity and high acoustic-phonetic variability, a challenge particularly acute in under-resourced languages. This thesis addresses this gap by developing a principled, data-efficient framework for personalizing large ASR models for impaired speech. The core of this work is Variational Inference Low-Rank Adaptation (VI-LoRA), a novel Bayesian fine-tuning method that learns a posterior distribution over adapter weights. This approach captures model uncertainty and provides powerful regularization against overfitting on limited data, further enhanced by an empirically-derived bimodal prior that better models the pre-trained weight distributions. To overcome data collection bottlenecks, the thesis introduces two key innovations: Semantic Re-chaining (SRC), a data augmentation technique that leverages Large Language Models to synthesize coherent, sentence-level training data from isolated word recordings; and the BF-Sprache dataset, a new, clinically-informed German speech corpus for a participant with a structural speech impairment. To guide the adaptation process, a composite Phoneme Difficulty Score (PhDScore) is proposed, which quantifies articulatory challenges by combining predictive error, model entropy, and prediction agreement. The framework was extensively evaluated on the public UA-Speech dataset and the new BF-Sprache dataset. Results demonstrate that VI-LoRA, especially when regularized, consistently outperforms standard LoRA and full fine-tuning. It achieves superior recognition accuracy on non-normative speech while simultaneously mitigating catastrophic forgetting of normative speech patterns. Furthermore, a strong correlation was established between the model's pre-trained uncertainty estimates and assessments from a clinical logopedic report, validating the PhDScore as a meaningful proxy for real-world speech difficulties. This thesis provides a pipeline, from data collection to model adaptation, for developing the next generation of inclusive ASR, presenting a viable pathway toward highly personalized assistive technologies that can yield clinically relevant insights. Automatische Spracherkennungssysteme (ASR) scheitern nach wie vor bei Personen mit nicht-normativer Sprache aufgrund von Datenknappheit und hoher akustisch-phonetischer Variabilität – ein Problem, das insbesondere in unterversorgten Sprachen gravierend ist. Diese Masterarbeit schließt diese Lücke durch die Entwicklung eines prinzipiellen, daten-effizienten Rahmens zur Personalisierung großer ASR-Modelle für beeinträchtigte Sprache. Im Zentrum der Arbeit steht Variational Inference Low-Rank Adaptation (VI-LoRA), eine neuartige bayesianische Fine-Tuning-Methode, die eine Posteriorverteilung über Adapter-Gewichte lernt. Dieser Ansatz erfasst die Modellunsicherheit und bietet eine starke Regularisierung gegen Überanpassung bei begrenzten Daten, zusätzlich verstärkt durch eine empirisch abgeleitete bimodale Prior, die die vortrainierten Gewichtungsverteilungen besser modelliert. Um Engpässe bei der Datenerhebung zu überwinden, führt die Arbeit zwei wesentliche Innovationen ein: Semantic Re-chaining (SRC), eine Datenaugmentierungstechnik, die große Sprachmodelle nutzt, um aus isolierten Wortaufnahmen kohärente, satzbasierte Trainingsdaten zu synthetisieren; sowie das BF-Sprache-Datenset, ein neuer, klinisch fundierter deutscher Sprachkorpus eines Teilnehmers mit struktureller Sprechstörung. Zur Steuerung des Anpassungsprozesses wird ein zusammengesetzter Phoneme Difficulty Score (PhDScore) vorgeschlagen, der artikulatorische Herausforderungen quantifiziert, indem er Vorhersagefehler, Modellentropie und Vorhersageübereinstimmung kombiniert. Der Rahmen wurde umfassend auf dem öffentlichen UA-Speech-Datenset und dem neuen BF-Sprache-Datenset evaluiert. Die Ergebnisse zeigen, dass VI-LoRA, insbesondere mit Regularisierung, standardmäßiges LoRA und vollständiges Fine-Tuning konsistent übertrifft. Es erzielt eine überlegene Erkennungsgenauigkeit bei nicht-normativer Sprache und reduziert gleichzeitig katastrophales Vergessen normativer Sprachmuster. Darüber hinaus konnte eine starke Korrelation zwischen den Unsicherheitsabschätzungen des vortrainierten Modells und den Bewertungen eines klinischen logopädischen Berichts nachgewiesen werden, wodurch der PhDScore als aussagekräftiger Proxy für reale Sprechschwierigkeiten validiert wird. Diese Arbeit bietet einen umfassenden Ablaufsplan, von der Datenerhebung bis zur Modellanpassung, für die Entwicklung der nächsten Generation inklusiver ASR-Systeme und weist einen vielversprechenden Weg zu hochgradig personalisierten Assistenztechnologien, die klinisch relevante Erkenntnisse liefern können.

Visit

doi.orgwww.research-collection.ethz.ch

Tasks

automatic speech recognitionspeech processing

Languages

Befang

Tags

Automatic Speech RecognitionDeep LearningBayesian learningUncertainty Quantification

Licenses

http://rightsstatements.org/page/InC-NC/1.0/In Copyright - Non-Commercial Use Permitted