Logo Lanfrica

Benchmark Pashto Handwritten Character Dataset and Pashto Object Character Recognition (OCR) Using Deep Neural Network with Rule Activation Function قياس مجموعة بيانات الأحرف البشتوية المكتوبة بخط اليد والتعرف على الأحرف البشتوية (OCR) باستخدام الشبكة العصبية العميقة مع وظيفة تنشيط القاعدة Benchmark Pashto Handwritten Character Dataset and Pashto Object Character Recognition (OCR) Using Deep Neural Network with Rule Activation Function Benchmark Pashto Handwritten Character Dataset and Pashto Object Character Recognition (OCR) Using Deep Neural Network with Rule Activation Function

Domaine:

natural language processing

Type de record:

datasetmodel
Créateur:
ImrDzaAbdJav
Éditeur:
Ope
Hôte:avatar
In the area of machine learning, different techniques are used to train machines and perform different tasks like computer vision, data analysis, natural language processing, and speech recognition. Computer vision is one of the main branches where machine learning and deep learning techniques are being applied. Optical character recognition (OCR) is the ability of a machine to recognize the character of a language. Pashto is one of the most ancient and historical languages of the world, spoken in Afghanistan and Pakistan. OCR application has been developed for various cursive languages like Urdu, Chinese, and Japanese, but very little work is done for the recognition of the Pashto language. When it comes to handwritten character recognition, it becomes more difficult for OCR to recognize the characters as every handwritten character's shape is influenced by the writer's hand motion dynamics. The reason for the lack of research in Pashto handwritten character data as compared to other languages is because there is no benchmark dataset available for experimental purposes. This study focuses on the creation of such a dataset, and then for the evaluation purpose, a machine is trained to correctly recognize unseen Pashto handwritten characters. To achieve this objective, a dataset of 43000 images was created. Three Feed Forward Neural Network models with backpropagation algorithm using different Rectified Linear Unit (ReLU) layer configurations (Model 1 with 1-ReLU Layer, Model 2 with 2-ReLU layers, and Model 3 with 3-ReLU Layers) were trained and tested with this dataset. The simulation shows that Model 1 achieved accuracy up to 87.6% on unseen data while Model 2 achieved an accuracy of 81.60% and 3% accuracy, respectively. Similarly, loss (cross-entropy) was the lowest for Model 1 with 0.15 and 3.17 for training and testing, followed by Model 2 with 0.7 and 4.2 for training and testing, while Model 3 was the last with loss values of 6.4 and 3.69. The precision, recall, and f-measure values of Model 1 were better than those of both Model 2 and Model 3. Based on results, Model 1 (with 1 ReLU activation layer) is found to be the most efficient as compared to the other two models in terms of accuracy to recognize Pashto handwritten characters. في مجال التعلم الآلي، يتم استخدام تقنيات مختلفة لتدريب الآلات وأداء مهام مختلفة مثل رؤية الكمبيوتر وتحليل البيانات ومعالجة اللغة الطبيعية والتعرف على الكلام. الرؤية الحاسوبية هي أحد الفروع الرئيسية التي يتم فيها تطبيق تقنيات التعلم الآلي والتعلم العميق. التعرف الضوئي على الحروف (OCR) هو قدرة الآلة على التعرف على شخصية اللغة. الباشتو هي واحدة من أكثر اللغات القديمة والتاريخية في العالم، ويتحدث بها في أفغانستان وباكستان. تم تطوير تطبيق التعرف الضوئي على الحروف لمختلف اللغات المخطوطة مثل الأردية والصينية واليابانية، ولكن لم يتم القيام إلا بالقليل جدًا من العمل للتعرف على لغة الباشتو. عندما يتعلق الأمر بالتعرف على الشخصيات المكتوبة بخط اليد، يصبح من الصعب على OCR التعرف على الشخصيات حيث يتأثر شكل كل شخصية مكتوبة بخط اليد بديناميكيات حركة يد الكاتب. يرجع سبب نقص البحث في بيانات الأحرف المكتوبة بخط اليد باللغة الباشتو مقارنة باللغات الأخرى إلى عدم وجود مجموعة بيانات مرجعية متاحة لأغراض تجريبية. تركز هذه الدراسة على إنشاء مجموعة البيانات هذه، ثم لغرض التقييم، يتم تدريب الآلة على التعرف بشكل صحيح على الأحرف الباشتوية المكتوبة بخط اليد غير المرئية. ولتحقيق هذا الهدف، تم إنشاء مجموعة بيانات من 43000 صورة. تم تدريب واختبار ثلاثة نماذج تغذية للشبكة العصبية الأمامية مع خوارزمية الانتشار الخلفي باستخدام تكوينات مختلفة لطبقة الوحدة الخطية المصححة (ReLU) (النموذج 1 مع طبقة 1 - ReLU، والنموذج 2 مع طبقات 2 - ReLU، والنموذج 3 مع طبقات 3 - ReLU) باستخدام مجموعة البيانات هذه. تظهر المحاكاة أن النموذج 1 حقق دقة تصل إلى 87.6 ٪ على البيانات غير المرئية بينما حقق النموذج 2 دقة 81.60 ٪ و 3 ٪ على التوالي. وبالمثل، كانت الخسارة (الانتروبيا المتقاطعة) هي الأدنى للنموذج 1 مع 0.15 و 3.17 للتدريب والاختبار، يليها النموذج 2 مع 0.7 و 4.2 للتدريب والاختبار، في حين كان النموذج 3 هو الأخير بقيم خسارة 6.4 و 3.69. كانت قيم الدقة والتذكر والقياس f للنموذج 1 أفضل من قيم كل من النموذج 2 والنموذج 3. بناءً على النتائج، وجد أن النموذج 1 (مع طبقة تنشيط ReLU واحدة) هو الأكثر كفاءة مقارنة بالنموذجين الآخرين من حيث الدقة للتعرف على الأحرف المكتوبة بخط اليد الباشتو. Dans le domaine de l'apprentissage automatique, différentes techniques sont utilisées pour entraîner les machines et effectuer différentes tâches telles que la vision par ordinateur, l'analyse de données, le traitement du langage naturel et la reconnaissance vocale. La vision par ordinateur est l'une des principales branches où les techniques d'apprentissage automatique et d'apprentissage profond sont appliquées. La reconnaissance optique de caractères (roc) est la capacité d'une machine à reconnaître le caractère d'une langue. Le pachtou est l'une des langues les plus anciennes et historiques du monde, parlée en Afghanistan et au Pakistan. L'application OCR a été développée pour diverses langues cursives comme l'ourdou, le chinois et le japonais, mais très peu de travail est fait pour la reconnaissance de la langue pachtoune. En ce qui concerne la reconnaissance des caractères manuscrits, il devient plus difficile pour l'OCR de reconnaître les caractères car la forme de chaque caractère manuscrit est influencée par la dynamique du mouvement de la main de l'écrivain. La raison du manque de recherche dans les données de caractères manuscrits en pachtoune par rapport à d'autres langues est qu'il n'y a pas d'ensemble de données de référence disponible à des fins expérimentales. Cette étude se concentre sur la création d'un tel ensemble de données, puis, à des fins d'évaluation, une machine est formée pour reconnaître correctement les caractères manuscrits pachtous invisibles. Pour atteindre cet objectif, un ensemble de données de 43000 images a été créé. Trois modèles de réseau neuronal Feed Forward avec algorithme de rétropropagation utilisant différentes configurations de couches d'unités linéaires rectifiées (ReLU) (modèle 1 avec couche 1-ReLU, modèle 2 avec couches 2-ReLU et modèle 3 avec couches 3-ReLU) ont été formés et testés avec cet ensemble de données. La simulation montre que le modèle 1 a atteint une précision allant jusqu'à 87,6 % sur des données invisibles tandis que le modèle 2 a atteint une précision de 81,60 % et 3 %, respectivement. De même, la perte (entropie croisée) était la plus faible pour le modèle 1 avec 0,15 et 3,17 pour la formation et les tests, suivie du modèle 2 avec 0,7 et 4,2 pour la formation et les tests, tandis que le modèle 3 était le dernier avec des valeurs de perte de 6,4 et 3,69. Les valeurs de précision, de rappel et de mesure f du modèle 1 étaient meilleures que celles des modèles 2 et 3. Sur la base des résultats, le modèle 1 (avec 1 couche d'activation ReLU) s'avère être le plus efficace par rapport aux deux autres modèles en termes de précision pour reconnaître les caractères manuscrits pachto. En el área del aprendizaje automático, se utilizan diferentes técnicas para entrenar máquinas y realizar diferentes tareas como visión artificial, análisis de datos, procesamiento del lenguaje natural y reconocimiento de voz. La visión artificial es una de las principales ramas donde se aplican las técnicas de aprendizaje automático y aprendizaje profundo. El reconocimiento óptico de caracteres (OCR) es la capacidad de una máquina para reconocer el carácter de un idioma. El pashto es una de las lenguas más antiguas e históricas del mundo, hablada en Afganistán y Pakistán. La aplicación OCR se ha desarrollado para varios idiomas cursivos como el urdu, el chino y el japonés, pero se trabaja muy poco para el reconocimiento del idioma pashto. Cuando se trata del reconocimiento de caracteres escritos a mano, se vuelve más difícil para OCR reconocer los caracteres, ya que la forma de cada personaje escrito a mano está influenciada por la dinámica de movimiento de la mano del escritor. La razón de la falta de investigación en los datos de caracteres escritos a mano en pastún en comparación con otros idiomas se debe a que no hay un conjunto de datos de referencia disponible para fines experimentales. Este estudio se centra en la creación de dicho conjunto de datos, y luego, para el propósito de la evaluación, se capacita a una máquina para reconocer correctamente los caracteres manuscritos pashto invisibles. Para lograr este objetivo, se creó un conjunto de datos de 43000 imágenes. Con este conjunto de datos se entrenaron y probaron tres modelos de red neuronal de alimentación directa con algoritmo de retropropagación utilizando diferentes configuraciones de capa de unidad lineal rectificada (ReLU) (modelo 1 con capa 1-ReLU, modelo 2 con capas 2-ReLU y modelo 3 con capas 3-ReLU). La simulación muestra que el Modelo 1 logró una precisión de hasta el 87,6% en datos invisibles, mientras que el Modelo 2 logró una precisión del 81,60% y del 3%, respectivamente. Del mismo modo, la pérdida (entropía cruzada) fue la más baja para el Modelo 1 con 0.15 y 3.17 para entrenamiento y pruebas, seguido del Modelo 2 con 0.7 y 4.2 para entrenamiento y pruebas, mientras que el Modelo 3 fue el último con valores de pérdida de 6.4 y 3.69. Los valores de precisión, recuperación y medida f del Modelo 1 fueron mejores que los del Modelo 2 y el Modelo 3. Según los resultados, el Modelo 1 (con 1 capa de activación de ReLU) es el más eficiente en comparación con los otros dos modelos en términos de precisión para reconocer caracteres manuscritos en pastún.

Languages

Licenses