Logo Lanfrica

First steps in developing an arabic OCR system

Domaine:

natural language processing

Type de record:

software
Créateur:
OulAmi
Éditeur:
Eco
Hôte:avatar
OCR systems present nowadays a very used tool to digitize documents in order to preserve them. This project aims to be a first step of realizing an Arabic OCR system. It is realized with the cooperation of the Tunisian National Archives which had provided the set of historical papers for the test of the different developed algorithms. In this Master Thesis, we had studied the feasibility of realizing such a system. Also, we had developed the necessary algorithms for the pre-processing stage. The pre-processing task includes Image binarization, Image enhancement, edge detection and skeletonization. Moreover, we had elaborated a system that detects cases characteristics within the document. La Reconnaissance optique de caractères présente à nos jours une méthode très utilisées pour la numérisation des documents dont le but de les protéger. Ce projet présente un premier pas pour réaliser un système de la Reconnaissance Optique des Caractères Arabes. Il a été réalisé avec la coopération du Centre Nationale d’Archives Tunisien qui a fourni l’ensemble des documents nécessaires pour le test des algorithmes développés. Dans cette thèse de mastère, nous avons étudié la faisabilité de réaliser un tel projet. Aussi, nous avons développé les algorithmes nécessaires pour la phase de prétraitement, qui inclut les tâches de binarisation des images, l’amélioration de la qualité des images, détection des bords et la squelettisation. Egalement, le système détecte les caractéristiques des cases.