Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Realization of a Tunisian Arabish Corpus with use within the scope of NLP-Natural Language Processing

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Eli
Éditeur:
Age
Hôte:
Création d'un corpus de arabish tunisien utilisable dans le domaine du Traitement Automatique des Langues Naturelles Ce travail vise à étudier l'arabe tunisien et, en même temps, à apporter une réponse au manque d'outils pour soutenir la recherche sur l'arabe tunisien. En particulier, l'objectif était de construire un corpus se prêtant à différents types d'analyses linguistiques, d'où les nombreux niveaux d'annotation dont nous l'avons doté. En particulier, nous avons restreint notre perspective à une variété spécifique de l'arabe tunisien, qui est celle utilisée pour la communication numérique et le partage d'identité, c'est-à-dire ce que nous avons défini comme Digital Networked Writing (DNW). De plus, nous avons collecté des textes encodés dans le système d'écriture typique dédié à ce contexte, c'est-à-dire l'arabizi.Dans le chapitre 1, nous avons présenté la complexité multilingue du tunisien, en fournissant au lecteur quelques clés fondamentales pour saisir les implications possibles de l'utilisation de ce système d'écriture. Parmi ces points clés, nous avons considéré l'histoire de ce pays, la classification dialectologique traditionnelle de l'arabe tunisien, l'interprétation historique et moderne de la répartition des différentes entités linguistiques sur le territoire. Le thème du plurilinguisme, en particulier, a servi de porte d'entrée aux questions ultérieures sur l'émergence d'une variété urbaine par rapport aux autres. Ici, en fait, nous avons mentionné la diffusion du tunisien dans la Communication Médiatisée par Ordinateur (CMO), et en particulier le double mode d'écriture, la digraphie. Enfin, nous avons présenté les principales caractéristiques de l'arabe tunisien.Dans le chapitre 2, après une brève introduction, nous avons exposé notre méthodologie. Tout d'abord, nous avons décrit les caractéristiques structurelles de la DNW et la manière dont elle est abordée par la recherche linguistique. Nous avons ensuite développé les bonnes pratiques à observer dans la construction de corpus linguistiques. Enfin, afin d'accélérer le processus et d'assurer la reproductibilité de la méthodologie adoptée, mais aussi d'étendre le bassin d'utilité tant du corpus que de la procédure elle-même, nous avons opté pour l'utilisation de techniques d'apprentissage profond (Deep Learning). Au final, nous avons fait le point sur l'état de l'art avec l’objective de partager des informations sur les différents types de travaux menés avec une méthodologie similaire à la nôtre sur l'Arabe Standard Moderne (ASM) et l'arabe dialectal. Un deuxième objectif était de mettre en évidence le manque de ressources disponibles pour soutenir la recherche sur l'arabe tunisien.Le chapitre 3 a traité des opérations spécifiques qui nous ont conduits à la création du corpus. Le chapitre a retracé le chemin à rebours, en commençant par la collecte des données et les décisions prises pour la sélection et la collecte des métadonnées des textes. Nous avons également décrit les étapes d'annotation semi-automatique du corpus dans ses couches d'annotation : classification au niveau des mots, translittération en caractères arabes, tokénisation, étiquetage de la partie du discours et lemmatisation. Enfin, nous avons décrit les résultats de la procédure d’annotation, réalisé à travers d’une architecture multi-tâches de prédiction de séquence. C'est l'outil qui a été construit pour produire les différentes couches d'annotation qui constituent le Tunisian Arabish Corpus (TArC) à partir du texte arabizi. L'autre résultat de la deuxième phase d'annotation est le corpus lui-même. Il est décrit, ainsi que des informations sur la quantité de données et de métadonnées qu'il comprend.Enfin, dans le chapitre 4, nous avons abordé l'enquête préliminaire. Les analyses ont visé à délimiter la nature du corpus lui-même et à entreprendre des stratégies linguistico-computationnelles pour observer la réalité linguistique de l’arabizi tunisien. Chacune de ces analyses est reproductible grâce à la mise à disposition des petits scripts utilisés pour les réaliser.

Visit

doi.org

Languages

LuyanaNotre

Similaires

NalediMsiya/Natural-Language-Processing-NLP-Tunisian Arabizi: Linguistic Analyses and Corpus Building using Natural Language ProcessingTArC: Tunisian Arabish Corpus First complete releaseNatural Language Processing (NLP) Analysis of the Bank of Algeria's CommuniquesTArC: Incrementally and Semi-Automatically Collecting a Tunisian Arabish CorpusNEMLAR CORPUS IMPROVEMENT FOR ARABIC NATURAL LANGUAGE PROCESSING

NalediMsiya/Natural-Language-Processing-NLP-

This is a dataset of wars recorded in Africa from the 1990's to 2023 , NLP is applied to analyze tex

Tunisian Arabizi: Linguistic Analyses and Corpus Building using Natural Language Processing

This work examines the use of Tunisian Arabic encoded in Arabizi, a non-standard orthographic system

TArC: Tunisian Arabish Corpus First complete release

In this paper we present the final result of a project on Tunisian Arabic encoded in Arabizi, the La

Natural Language Processing (NLP) Analysis of the Bank of Algeria's Communiques

This research applies text mining and natural language processing (NLP) methods to examine the commu

TArC: Incrementally and Semi-Automatically Collecting a Tunisian Arabish Corpus

This article describes the constitution process of the first morpho-syntactically annotated Tunisian

NEMLAR CORPUS IMPROVEMENT FOR ARABIC NATURAL LANGUAGE PROCESSING

Most machine learning approaches in Natural Language Processing rely mainly on corpora. Indeed, vari