Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Fine-tuning de modèles de langues pour la veille épidémiologique multilingue avec peu de ressources

Domaine:

natural language processinghealthcare

Type de record:

paper
Créateur:
MutBorDouJat
Éditeur:
LabLeoSenÉqu
Éditeur:
CCSDATA
Hôte:avatar
National audience Les modèles de langues pré-entraînés connaissent un très grand succès en TAL, en particulier dans les situations où l’on dispose de suffisamment de données d’entraînement. Cependant, il reste difficile d’obtenir des résultats similaires dans des environnements multilingues avec peu de données d’entraînement, en particulier dans des domaines spécialisés tels que la surveillance des épidémies. Dans cet article, nous explorons plusieurs hypothèses concernant les facteurs qui pourraient avoir une influence sur les performances d’un système d’extraction d’événements épidémiologiques dans un scénario multilingue à faibles ressources : le type de modèle pré-entraîné, la qualité du tokenizer ainsi que les caractéristiques des entités à extraire. Nous proposons une analyse exhaustive de ces facteurs et observons une corrélation importante, quoique variable ; entre ces caractéristiques et les performances observées sur la base d’une tâche de veille épidémiologique multilingue à faibles ressources. Nous proposons aussi d’adapter les modèles de langues à cette tâche en étendant le vocabulaire du tokenizer pré-entraîné avec les entités continues, qui sont des entités qui ont été divisées en plusieurs sous-mots. Suite à cette adaptation, nous observons une amélioration notable des performances pour la plupart des modèles et des langues évalués.

Visit

hal.science

Tasks

information extraction

Tags

extraction d’événements épidémiologiqueslangues peu dotéesmodèles de langues.[INFO.INFO-CL]Computer Science [cs]/Computation and Language [cs.CL]

Licenses

info:eu-repo/semantics/OpenAccess

Similaires

Fine-tuning Whisper with Spontaneous Persian Speech (SPS) Affinage du modèle multilingue de Whisper avec un corpus de persan spontanéAugmentation de données pour la classification de séries temporelles avec des modèles d'apprentissage profondsManipulation de dictionnaires d'origines diverses pour des langues peu dotées : la méthodologie iBaatukaayExploration de la séparation en langues dans les modèles de traitement de la parole auto-supervisés multilingues préentraînés avec des données écologiquesGénérateur de dictionnaires au format Android pour les langues peu dotéesProduire des ressources électroniques à partir de descriptions formelles : application aux langues peu dotées

Fine-tuning Whisper with Spontaneous Persian Speech (SPS) Affinage du modèle multilingue de Whisper avec un corpus de persan spontané

International audience This paper introduces the Spontaneous Persian Speech (SPS) dat

Augmentation de données pour la classification de séries temporelles avec des modèles d'apprentissage profonds

International audience L’augmentation des données est un moyen efficace pour remédier

Manipulation de dictionnaires d'origines diverses pour des langues peu dotées : la méthodologie iBaatukaay

International audience Generally, African languages are less-resourced languages. Mos

Exploration de la séparation en langues dans les modèles de traitement de la parole auto-supervisés multilingues préentraînés avec des données écologiques

National audience Les modèles auto-supervisés omnilingues de traitement de la parole

Générateur de dictionnaires au format Android pour les langues peu dotées

Nous présentons un outil informatique en source libre permettant, à partir d’un dicti

Produire des ressources électroniques à partir de descriptions formelles : application aux langues peu dotées

National audience Dans cet article, nous montrons comment les langages de description