Logo Lanfrica

Fine-tuning Whisper with Spontaneous Persian Speech (SPS) Affinage du modèle multilingue de Whisper avec un corpus de persan spontané

Domaine:

natural language processing

Type de record:

paperdataset
Créateur:
NamBal
Éditeur:
AppUFRUniELRA
Éditeur:
CCSD
Hôte:avatar
International audience This paper introduces the Spontaneous Persian Speech (SPS) dataset designed for automatic speech recognition (ASR) tasks and a methodology laying the groundwork for addressing the shortage of spontaneous speech data. The corpus aims to support research on natural and conversational Persian, which remains under-represented in current ASR resources. The dataset consists of 694 minutes of audio from a total of 65 speakers, including 34 male and 31 female speakers. It contains 526,585 tokens. The audio segmentation step produces intervals of 1.24 to 3.25 seconds, each containing 3 to 9 words. The recordings cover a variety of environments, from inside cars to homes and shopping areas, including both busy and quiet settings. We use the SPS dataset to fine-tune Whisper and the performance increases significantly for both the small and medium models based on Word Error Rate (WER). This could be an initiative toward building domain-oriented datasets for specific ASR tasks. Cet article présente le corpus Spontaneous Persian Speech (SPS), conçu pour les tâches de reconnaissance automatique de la parole (Automatic Speech Recognition, ASR), ainsi qu'une méthodologie qui pose les bases pour remédier au manque de données de parole spontanée en persan. Ce corpus SPS a pour objectif de soutenir la recherche sur le persan spontané, qui demeure sous-représenté dans les ressources actuelles destinées à l'ASR.Le jeu de données comprend 694 minutes d'enregistrements audio provenant de 65 locuteurs ( 34 hommes et 31 femmes). Il contient un total de 526 585 tokens. L'étape de segmentation du signal audio produit des segments d'une durée comprise entre 1,24 et 3,25 secondes, chacun contenant de 3 à 9 mots. Les enregistrements couvrent une grande diversité de conditions d'enregistrement, allant de l'intérieur de véhicules à des domiciles et des zones commerciales, dans des contextes aussi bien bruyants que calmes.Nous utilisons le corpus SPS pour affiner (fine-tuner) le modèle Whisper, ce qui améliore significativement les performances des modèles small et medium, telles qu'évaluées par le taux d'erreur sur les mots (Word Error Rate, WER). Cette approche pourrait constituer une première étape vers la création de corpus spécialisés, adaptés à des domaines ou à des tâches spécifiques de reconnaissance automatique de la parole.