Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Extraction d’information pour la langue Arabe et ses dialectes Information extraction for arabic and its dialects

Domain:

natural language processing

Record type:

paper
Creator:
Elk
Editor:
LabUniThiNad
Publisher:
CCSD
Host:avatar
The exponential growth of textual data has underscored the importance of Information Extraction (IE) as a crucial subfield of Natural Language Processing (NLP). This PhD thesis advances the state of the art in IE, with a particular focus on the Arabic language and its dialects, which present unique challenges due to their rich morphological structure, diacritic variability, and dialectal diversity. The research is organized around three major contributions.Firstly, we introduce the first neural joint information extraction system designed specifically for Modern Standard Arabic (MSA). This model integrates BERT-based token encoding with Conditional Random Fields (CRFs) for entity and event trigger identification, and Feed Forward Neural Networks (FFNs) for relation and event argument classification. Our model effectively navigates the complexities of Arabic morphology, setting a new benchmark for IE performance in Arabic.Secondly, the thesis explores Cross-Dialectal Named Entity Recognition (NER) in Arabic. We construct comprehensive datasets for Egyptian, Moroccan, and Syrian Arabic dialects, and explore the transferability of NER models trained on MSA to these dialects in a zero-shot setting. This approach significantly mitigates the challenge of limited annotated resources, enabling broader application of NER across diverse Arabic-speaking regions.Finally, we propose a novel framework for joint IE tasks, employing Differentiable Beam Search on Graph Recurrent Neural Networks (GRNNs). This method tackles the issue of exposure bias in sequence-to-sequence models, enhancing the model's ability to capture and leverage interdependencies between entities, relations, and events. The approach demonstrates robust performance across multiple languages, including Arabic, providing a versatile tool for multilingual IE.This thesis not only advances Arabic NLP by addressing its specific linguistic challenges but also contributes to the broader field of multilingual information extraction, offering new methodologies and insights for future research La croissance exponentielle des données textuelles a souligné l'importance de l'extraction d'information en tant que sous-domaine crucial du traitement automatique du langage naturel (TALN). Cette thèse de doctorat fait progresser l'état de l'art de l'IE, avec un accent particulier sur la langue arabe et ses dialectes, qui présentent des défis uniques en raison de leur structure morphologique riche, de la variabilité des diacritiques et de la diversité dialectale. La recherche s'articule autour de trois contributions majeures. Premièrement, nous introduisons le premier système d'extraction d'information neuronale conjointe spécifiquement conçu pour l'arabe standard moderne (ASM). Ce modèle intègre un encodage basé sur BERT pour les tokens avec des champs aléatoires conditionnels (CRF) pour l'identification des entités et des déclencheurs d'événements, ainsi que des réseaux de neurones feedforward (FFN) pour la classification des relations et des arguments d'événements. Notre modèle navigue efficacement dans les complexités de la morphologie arabe, établissant un nouveau standard de performance pour l'IE en arabe. Deuxièmement, la thèse explore la reconnaissance d'entités nommées (NER) à travers les dialectes arabes. Nous construisons des ensembles de données complets pour les dialectes égyptien, marocain et syrien, et explorons la transférabilité des modèles NER entraînés sur l'ASM vers ces dialectes dans un cadre sans apprentissage préalable (zero-shot). Cette approche atténue considérablement le défi des ressources annotées limitées, permettant une application plus large du NER dans diverses régions arabophones.Enfin, nous proposons un cadre novateur pour les tâches d'IE conjointes, en utilisant la recherche par faisceau différentiable sur des réseaux de neurones récurrents graphiques (GRNN). Cette méthode s'attaque au problème du biais d'exposition dans les modèles séquence-à-séquence, améliorant la capacité du modèle à capturer et à exploiter les interdépendances entre les entités, les relations et les événements. L'approche démontre des performances solides dans plusieurs langues, y compris l'arabe, offrant un outil polyvalent pour l'IE multilingue.Cette thèse fait non seulement progresser le TALN en arabe en répondant à ses défis linguistiques spécifiques, mais contribue également au domaine plus large de l'extraction d'information multilingue, en offrant de nouvelles méthodologies et des perspectives pour la recherche future.

Visit

theses.hal.science

Tasks

information extractionnamed entity recognition

Languages

Notre

Tags

Arabic Language Pro- cessingNamed Entity RecognitionJoint Information ExtractionTraitement du langage naturel arabe.Reconnaissance d'entités nomméesExtraction d'informations jointe[INFO.INFO-CL]Computer Science [cs]/Computation and Language [cs.CL]

Licenses

info:eu-repo/semantics/OpenAccess

Similar

La langue soṅay et ses dialectesLa Langue Mandingue et ses Dialectes (Malinke, Bambara, Dioula)« Introduction », dans La langue mandingue et ses dialectes (maliké, bambara, dioula).Supervised Syntactic Approach for French Open Information Extraction Open Information Extraction: Approche Supervisée et Syntaxique pour le FrançaisLa langue mandingue et ses dialectes (malinké, bambara, dioula), volumes I and IILa langue soṅay et ses dialectes Dictionnaire soṅay-français Lexique français-soṅay

La langue soṅay et ses dialectes

short grammar along with texts and lexicon of the Songhay language of Gao, Mali, also known as Koyra

La Langue Mandingue et ses Dialectes (Malinke, Bambara, Dioula)

« Introduction », dans La langue mandingue et ses dialectes (maliké, bambara, dioula).

Transcription de: Maurice Delafosse, « Introduction », dans La langue mandingue et ses dialectes (ma

Supervised Syntactic Approach for French Open Information Extraction Open Information Extraction: Approche Supervisée et Syntaxique pour le Français

International audience Most of Open Information Extraction approaches focus on Englis

La langue mandingue et ses dialectes (malinké, bambara, dioula), volumes I and II

La langue soṅay et ses dialectes Dictionnaire soṅay-français Lexique français-soṅay

Includes bibliographical references Introduction -- Grammaire -- Textes -- Dictionnaire soṅay-frança