Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Advancing Arabic Diacritization: Improved Datasets, Benchmarking, and State-of-the-Art Models

Domaine:

natural language processing

Type de record:

paper
Créateur:
AssMohMub
Éditeur:
Und
Hôte:avatar
Arabic diacritics, similar to short vowels in English, provide phonetic and grammatical information but are typically omitted in written Arabic, leading to ambiguity. Diacritization (aka diacritic restoration or vowelization) is essential for natural language processing. This paper advances Arabic diacritization through the following contributions: first, we propose a methodology to analyze and refine a large diacritized corpus to improve training quality. Second, we introduce WikiNews-2024, a multi-reference evaluation methodology with an updated version of the standard benchmark ``WikiNews-2014''. In addition, we propose a BiLSTM-based model that achieves state-of-the-art results with 3.12% and 2.70% WER on WikiNews-2014 and WikiNews-2024. Moreover, we develop a model that preserves user-specified diacritics while maintaining accuracy. Lastly, we demonstrate that augmenting training data enhances performance in low-resource settings.

Visit

doi.orgunderline.io

Tasks

diacritic restorationtext normalization

Tags

Computational LinguisticsArtificial IntelligenceInformation and Knowledge Engineering

Similaires

Fine-Tashkeel: Finetuning Byte-Level Models for Accurate Arabic Text DiacritizationDiacritization of Maghrebi Arabic Sub-DialectsFine-Tashkeel: Fine-Tuning Byte-Level Models for Accurate Arabic Text DiacritizationTounsiBench: Benchmarking Large Language Models for Tunisian ArabicBALSAM: A Platform for Benchmarking Arabic Large Language ModelsSouha-BH/TounsiBench-Benchmarking-Large-Language-Models-for-Tunisian-Arabic

Fine-Tashkeel: Finetuning Byte-Level Models for Accurate Arabic Text Diacritization

Most of previous work on learning diacritization of the Arabic language relied on training models fr

Diacritization of Maghrebi Arabic Sub-Dialects

Diacritization process attempt to restore the short vowels in Arabic written text; which typically a

Fine-Tashkeel: Fine-Tuning Byte-Level Models for Accurate Arabic Text Diacritization

TounsiBench: Benchmarking Large Language Models for Tunisian Arabic

BALSAM: A Platform for Benchmarking Arabic Large Language Models

The impressive advancement of Large Language Models (LLMs) in English has not been matched across al

Souha-BH/TounsiBench-Benchmarking-Large-Language-Models-for-Tunisian-Arabic

# TounsiBench-Benchmarking-Large-Language-Models-for-Tunisian-Arabic Thank you for using the Tounsi