Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Semi-supervised and transfer learning for few-shot audio classification

Domain:

natural language processing

Record type:

datasetpaper
Creator:
Gro
Editor:
ThüBraStoBös
Publisher:
TU
Host:avatar
Deep Learning hat zu erheblichen Fortschritten in der Audioanalyse geführt, doch die Abhängigkeit von großen, gelabelten Datensätzen stellt in spezialisierten Bereichen wie der Musikwissenschaft und der industriellen Qualitätskontrolle ein wesentliches Hindernis dar. Diese Arbeit untersucht Transfer Learning (TL) und Semi-supervised Learning (SSL) als Trainingsmethoden für Audioklassifikationsmodelle in Few-Shot-Learning-Szenarien, in denen nur begrenzt annotierte Daten zur Verfügung stehen. Um die Generalisierbarkeit zu bewerten, verwendet diese Arbeit Datensätze aus drei verschiedenen Domänen: Musikklassifikation, industrielle Klanganalyse und akustische Szenenklassifikation. Ein wesentlicher Beitrag dieser Arbeit umfasst die Erstellung und Veröffentlichung neuer Datensätze: ACMusIF für traditionelle kolumbianische Musik sowie die Datensätze Metal Ball und Pucks zur Klassifikation von Metalloberflächen und Kunststoffmaterialien. Zusätzlich werden die öffentlichen Datensätzen (NSynth, TUT2017) einbezogen. Die Ergebnisse für Convolutional Neural Networks zeigten, dass überwachtes Lernen zwar effektiv ist, die Genauigkeit jedoch sinkt, wenn die Anzahl der gelabelten Beispiele reduziert wird – ein Verlust, der durch künstliche Datenerweiterung nicht vollständig kompensiert werden kann. Als Alternative wurde TL unter Verwendung vortrainierter Modelle wie OpenL3 und PANNs systematisch evaluiert. OpenL3 schnitt im Durchschnitt am besten ab und übertrifft die Baselines insbesondere dann, wenn gelabelte Daten knapp waren. Bemerkenswert ist, dass sich das Vortraining auf Musikdaten effektiv auf industrielle Klänge verallgemeinern lässt. Außerdem wurde die SSL-Methode FixMatch von der Bild- auf die Audiodomäne übertragen. Hierbei wurde eine neue Methode zur Auswahl von Datenaugmentierungstechniken eingeführt. FixMatch wird mit den Baselines, TL und dem Mean-Teacher-Ansatz verglichen. Die Ergebnisse zeigen, dass FixMatch diese Alternativen in allen Aufgaben übertrifft und auf drei der vier untersuchten Datensätze mit weniger als 10 % der gelabelten Daten eine Leistung erreicht, die der von vollständig überwachten Modellen ebenbürtig ist. Obwohl die Genauigkeit bei weniger als zehn annotierten Beispielen pro Klasse abnimmt, bestätigen die Ergebnisse die Wirksamkeit fortgeschrittener SSL- und TL-Techniken in der Audioklassifikation. Deep learning has driven significant progress in audio analysis, yet its dependence on large labeled datasets poses a substantial barrier in specialized domains such as musicology and industrial quality control. This thesis addresses the challenge of data scarcity by investigating Transfer Learning (TL) and Semi-supervised Learning (SSL) strategies for audio classification. The primary objective is to develop training methodologies that maintain high classification performance under few-shot learning scenarios, where labeled data is limited. To assess generalizability, this thesis utilizes datasets across three distinct domains: Music Information Retrieval, Industrial Sound Analysis, and Acoustic Scene Classification. A significant contribution of this work includes the creation and publication of novel datasets: ACMusIF for traditional Colombian music, and the MetalBall and Pucks datasets for metal surface and plastic material classification. These are analyzed alongside public datasets (NSynth, TUT2017). Results for Convolutional Neural Networks demonstrate that while supervised learning is effective, accuracy decreases when labeled examples are reduced, a loss that standard data augmentation cannot fully recover. As an alternative, TL using pre-trained models such as OpenL3 and PANNs is systematically evaluated. OpenL3 performed best on average, improving upon the supervised baselines especially when labeled data is scarce. Notably, pre-training on music generalizes effectively to industrial sounds, suggesting that strict domain alignment is not necessary for effective TL. Furthermore, this thesis adapts the FixMatch SSL method from the image to the audio domain. A novel method for effectively selecting the data augmentation techniques is introduced. FixMatch is compared against supervised baselines, TL, and the Mean Teacher approach. Results show that FixMatch outperforms these alternatives on all tasks. Crucially, it achieves parity with fully supervised models using less than 10% of the labeled data on three of the four investigated datasets. Although performance gains diminish with fewer than ten labeled examples per class, the findings confirm the efficacy of advanced SSL and TL techniques in resource-constrained audio classification.

Visit

doi.orgwww.db-thueringen.de

Tasks

transfer learning

Languages

BefangDass

Tags

TonsignalSignalanalyseKlassifikationTransfer LearningNeuronales Netz621.3

Licenses

all rights reserved

Similar

Transfer Learning with Semi-Supervised Dataset Annotation for Birdcall ClassificationSemi-supervised and Transfer learning approaches for low resource sentiment classificationSemi-Supervised Triply Robust Inductive Transfer LearningIntermediate-Task Training and Few-Shot Learning for Cross-Domain Robustness in Zero-Shot Cross-Lingual TransferReconstructing Human Mobility Pattern: A Semi-Supervised Approach for Cross-Dataset Transfer LearningBUFFET: Benchmarking Large Language Models for Few-shot Cross-lingual Transfer

Transfer Learning with Semi-Supervised Dataset Annotation for Birdcall Classification

We present working notes on transfer learning with semi-supervised dataset annotation for the BirdCL

Semi-supervised and Transfer learning approaches for low resource sentiment classification

Sentiment classification involves quantifying the affective reaction of a human to a document, media

Semi-Supervised Triply Robust Inductive Transfer Learning

In this work, we propose a Semi-supervised Triply Robust Inductive transFer LEarning (STRIFLE) ap

Intermediate-Task Training and Few-Shot Learning for Cross-Domain Robustness in Zero-Shot Cross-Lingual Transfer

Pre-trained multilingual language encoders, such as multilingual BERT and XLM-R, show great potentia

Reconstructing Human Mobility Pattern: A Semi-Supervised Approach for Cross-Dataset Transfer Learning

Understanding human mobility patterns is crucial for urban planning, transportation management, and

BUFFET: Benchmarking Large Language Models for Few-shot Cross-lingual Transfer

Despite remarkable advancements in few-shot generalization in natural language processing, most mode