The exponential growth of textual data has underscored the importance of Information Extraction (IE) as a crucial subfield of Natural Language Processing (NLP). This PhD thesis advances the state of the art in IE, with a particular focus on the Arabic language and its dialects, which present unique challenges due to their rich morphological structure, diacritic variability, and dialectal diversity. The research is organized around three major contributions.Firstly, we introduce the first neural joint information extraction system designed specifically for Modern Standard Arabic (MSA). This model integrates BERT-based token encoding with Conditional Random Fields (CRFs) for entity and event trigger identification, and Feed Forward Neural Networks (FFNs) for relation and event argument classification. Our model effectively navigates the complexities of Arabic morphology, setting a new benchmark for IE performance in Arabic.Secondly, the thesis explores Cross-Dialectal Named Entity Recognition (NER) in Arabic. We construct comprehensive datasets for Egyptian, Moroccan, and Syrian Arabic dialects, and explore the transferability of NER models trained on MSA to these dialects in a zero-shot setting. This approach significantly mitigates the challenge of limited annotated resources, enabling broader application of NER across diverse Arabic-speaking regions.Finally, we propose a novel framework for joint IE tasks, employing Differentiable Beam Search on Graph Recurrent Neural Networks (GRNNs). This method tackles the issue of exposure bias in sequence-to-sequence models, enhancing the model's ability to capture and leverage interdependencies between entities, relations, and events. The approach demonstrates robust performance across multiple languages, including Arabic, providing a versatile tool for multilingual IE.This thesis not only advances Arabic NLP by addressing its specific linguistic challenges but also contributes to the broader field of multilingual information extraction, offering new methodologies and insights for future research
La croissance exponentielle des données textuelles a souligné l'importance de l'extraction d'information en tant que sous-domaine crucial du traitement automatique du langage naturel (TALN). Cette thèse de doctorat fait progresser l'état de l'art de l'IE, avec un accent particulier sur la langue arabe et ses dialectes, qui présentent des défis uniques en raison de leur structure morphologique riche, de la variabilité des diacritiques et de la diversité dialectale. La recherche s'articule autour de trois contributions majeures. Premièrement, nous introduisons le premier système d'extraction d'information neuronale conjointe spécifiquement conçu pour l'arabe standard moderne (ASM). Ce modèle intègre un encodage basé sur BERT pour les tokens avec des champs aléatoires conditionnels (CRF) pour l'identification des entités et des déclencheurs d'événements, ainsi que des réseaux de neurones feedforward (FFN) pour la classification des relations et des arguments d'événements. Notre modèle navigue efficacement dans les complexités de la morphologie arabe, établissant un nouveau standard de performance pour l'IE en arabe. Deuxièmement, la thèse explore la reconnaissance d'entités nommées (NER) à travers les dialectes arabes. Nous construisons des ensembles de données complets pour les dialectes égyptien, marocain et syrien, et explorons la transférabilité des modèles NER entraînés sur l'ASM vers ces dialectes dans un cadre sans apprentissage préalable (zero-shot). Cette approche atténue considérablement le défi des ressources annotées limitées, permettant une application plus large du NER dans diverses régions arabophones.Enfin, nous proposons un cadre novateur pour les tâches d'IE conjointes, en utilisant la recherche par faisceau différentiable sur des réseaux de neurones récurrents graphiques (GRNN). Cette méthode s'attaque au problème du biais d'exposition dans les modèles séquence-à-séquence, améliorant la capacité du modèle à capturer et à exploiter les interdépendances entre les entités, les relations et les événements. L'approche démontre des performances solides dans plusieurs langues, y compris l'arabe, offrant un outil polyvalent pour l'IE multilingue.Cette thèse fait non seulement progresser le TALN en arabe en répondant à ses défis linguistiques spécifiques, mais contribue également au domaine plus large de l'extraction d'information multilingue, en offrant de nouvelles méthodologies et des perspectives pour la recherche future.