Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Semi-supervised and transfer learning for few-shot audio classification

Domaine:

natural language processing

Type de record:

datasetpaper
Créateur:
Gro
Éditeur:
ThüBraStoBös
Éditeur:
TU
Hôte:avatar
Deep Learning hat zu erheblichen Fortschritten in der Audioanalyse geführt, doch die Abhängigkeit von großen, gelabelten Datensätzen stellt in spezialisierten Bereichen wie der Musikwissenschaft und der industriellen Qualitätskontrolle ein wesentliches Hindernis dar. Diese Arbeit untersucht Transfer Learning (TL) und Semi-supervised Learning (SSL) als Trainingsmethoden für Audioklassifikationsmodelle in Few-Shot-Learning-Szenarien, in denen nur begrenzt annotierte Daten zur Verfügung stehen. Um die Generalisierbarkeit zu bewerten, verwendet diese Arbeit Datensätze aus drei verschiedenen Domänen: Musikklassifikation, industrielle Klanganalyse und akustische Szenenklassifikation. Ein wesentlicher Beitrag dieser Arbeit umfasst die Erstellung und Veröffentlichung neuer Datensätze: ACMusIF für traditionelle kolumbianische Musik sowie die Datensätze Metal Ball und Pucks zur Klassifikation von Metalloberflächen und Kunststoffmaterialien. Zusätzlich werden die öffentlichen Datensätzen (NSynth, TUT2017) einbezogen. Die Ergebnisse für Convolutional Neural Networks zeigten, dass überwachtes Lernen zwar effektiv ist, die Genauigkeit jedoch sinkt, wenn die Anzahl der gelabelten Beispiele reduziert wird – ein Verlust, der durch künstliche Datenerweiterung nicht vollständig kompensiert werden kann. Als Alternative wurde TL unter Verwendung vortrainierter Modelle wie OpenL3 und PANNs systematisch evaluiert. OpenL3 schnitt im Durchschnitt am besten ab und übertrifft die Baselines insbesondere dann, wenn gelabelte Daten knapp waren. Bemerkenswert ist, dass sich das Vortraining auf Musikdaten effektiv auf industrielle Klänge verallgemeinern lässt. Außerdem wurde die SSL-Methode FixMatch von der Bild- auf die Audiodomäne übertragen. Hierbei wurde eine neue Methode zur Auswahl von Datenaugmentierungstechniken eingeführt. FixMatch wird mit den Baselines, TL und dem Mean-Teacher-Ansatz verglichen. Die Ergebnisse zeigen, dass FixMatch diese Alternativen in allen Aufgaben übertrifft und auf drei der vier untersuchten Datensätze mit weniger als 10 % der gelabelten Daten eine Leistung erreicht, die der von vollständig überwachten Modellen ebenbürtig ist. Obwohl die Genauigkeit bei weniger als zehn annotierten Beispielen pro Klasse abnimmt, bestätigen die Ergebnisse die Wirksamkeit fortgeschrittener SSL- und TL-Techniken in der Audioklassifikation. Deep learning has driven significant progress in audio analysis, yet its dependence on large labeled datasets poses a substantial barrier in specialized domains such as musicology and industrial quality control. This thesis addresses the challenge of data scarcity by investigating Transfer Learning (TL) and Semi-supervised Learning (SSL) strategies for audio classification. The primary objective is to develop training methodologies that maintain high classification performance under few-shot learning scenarios, where labeled data is limited. To assess generalizability, this thesis utilizes datasets across three distinct domains: Music Information Retrieval, Industrial Sound Analysis, and Acoustic Scene Classification. A significant contribution of this work includes the creation and publication of novel datasets: ACMusIF for traditional Colombian music, and the MetalBall and Pucks datasets for metal surface and plastic material classification. These are analyzed alongside public datasets (NSynth, TUT2017). Results for Convolutional Neural Networks demonstrate that while supervised learning is effective, accuracy decreases when labeled examples are reduced, a loss that standard data augmentation cannot fully recover. As an alternative, TL using pre-trained models such as OpenL3 and PANNs is systematically evaluated. OpenL3 performed best on average, improving upon the supervised baselines especially when labeled data is scarce. Notably, pre-training on music generalizes effectively to industrial sounds, suggesting that strict domain alignment is not necessary for effective TL. Furthermore, this thesis adapts the FixMatch SSL method from the image to the audio domain. A novel method for effectively selecting the data augmentation techniques is introduced. FixMatch is compared against supervised baselines, TL, and the Mean Teacher approach. Results show that FixMatch outperforms these alternatives on all tasks. Crucially, it achieves parity with fully supervised models using less than 10% of the labeled data on three of the four investigated datasets. Although performance gains diminish with fewer than ten labeled examples per class, the findings confirm the efficacy of advanced SSL and TL techniques in resource-constrained audio classification.

Visit

doi.orgwww.db-thueringen.de

Tasks

transfer learning

Languages

BefangDass

Tags

TonsignalSignalanalyseKlassifikationTransfer LearningNeuronales Netz621.3

Licenses

all rights reserved