Logo Lanfrica

PHTI: Pashto Handwritten Text Imagebase for Deep Learning Applications PHTI: قاعدة صور نصية مكتوبة بخط اليد للباشتو لتطبيقات التعلم العميق PHTI : Pashto Handwritten Text Imagebase pour les applications de Deep Learning PHTI: Pashto Handwritten Text Imagebase para aplicaciones de aprendizaje profundo

Domaine:

natural language processing

Type de record:

dataset
Créateur:
IbrRiaSirKha
Éditeur:
Ope
Hôte:avatar
Document Image Analysis (DIA) is one of the research areas of Artificial Intelligence (AI) that converts document images into machine-readable codes. In DIA systems, Optical Character Recognition (OCR) plays a key role in digitizing document images. The output of an OCR system is further used in many applications including, Natural Language Processing (NLP), Sentiment Analysis, Speech Recognition, and Translation Services. However, standard datasets are an essential requirement for the development, evaluation and comparison of different text recognition techniques. Pashto is one of such low resource languages that lacks availability regarding standard dataset of handwritten text. This paper therefore, addresses the unavailability of standard dataset for the Pashto handwritten text by developing a dataset named Pashto Handwritten Text Imagebase (PHTI). The PHTI is created by collecting handwritten samples from diverse genre of the Pashto language including poetry, religion, short stories, articles, novels, sports, culture and news. The dataset consists of 4,000 scanned images, written by 400 writers including 200 males and 200 females. These 4,000 images are further segmented into 36,082 text-line images. Each text-line image is annotated/ transcribed with UTF-8 codecs. The dataset can be used for many deep learning-based applications including, text recognition, skew detection, gender classification and age-groups classification. يعد تحليل صورة المستند (DIA) أحد المجالات البحثية للذكاء الاصطناعي (AI) الذي يحول صور المستند إلى رموز قابلة للقراءة آليًا. في أنظمة DIA، يلعب التعرف الضوئي على الأحرف (OCR) دورًا رئيسيًا في رقمنة صور المستندات. يتم استخدام مخرجات نظام التعرف الضوئي على الحروف بشكل أكبر في العديد من التطبيقات بما في ذلك معالجة اللغة الطبيعية (NLP) وتحليل المشاعر والتعرف على الكلام وخدمات الترجمة. ومع ذلك، فإن مجموعات البيانات القياسية هي مطلب أساسي لتطوير وتقييم ومقارنة تقنيات التعرف على النصوص المختلفة. الباشتو هي واحدة من هذه اللغات منخفضة الموارد التي تفتقر إلى التوافر فيما يتعلق بمجموعة البيانات القياسية للنص المكتوب بخط اليد. لذلك، تتناول هذه الورقة عدم توفر مجموعة بيانات قياسية للنص المكتوب بخط اليد للباشتو من خلال تطوير مجموعة بيانات تسمى قاعدة صور النص المكتوب بخط اليد للباشتو (PHTI). يتم إنشاء PHTI من خلال جمع عينات مكتوبة بخط اليد من أنواع متنوعة من لغة الباشتو بما في ذلك الشعر والدين والقصص القصيرة والمقالات والروايات والرياضة والثقافة والأخبار. تتكون مجموعة البيانات من 4000 صورة ممسوحة ضوئيًا، كتبها 400 كاتب بما في ذلك 200 ذكر و 200 أنثى. يتم تقسيم هذه الصور البالغ عددها 4000 صورة إلى 36،082 صورة نصية. يتم شرح/ نسخ كل صورة نصية باستخدام برامج ترميز UTF -8. يمكن استخدام مجموعة البيانات للعديد من التطبيقات القائمة على التعلم العميق بما في ذلك التعرف على النص واكتشاف الانحراف وتصنيف النوع الاجتماعي وتصنيف الفئات العمرية. L'analyse d'images de documents (DIA) est l'un des domaines de recherche de l'intelligence artificielle (IA) qui convertit les images de documents en codes lisibles par machine. Dans les systèmes DIA, la reconnaissance optique de caractères (OCR) joue un rôle clé dans la numérisation des images de documents. La sortie d'un système OCR est également utilisée dans de nombreuses applications, notamment le traitement du langage naturel (NLP), l'analyse des sentiments, la reconnaissance vocale et les services de traduction. Cependant, les ensembles de données standard sont une exigence essentielle pour le développement, l'évaluation et la comparaison de différentes techniques de reconnaissance de texte. Le pachtou est l'une de ces langues à faibles ressources qui manque de disponibilité en ce qui concerne l'ensemble de données standard de texte manuscrit. Cet article traite donc de l'indisponibilité de l'ensemble de données standard pour le texte manuscrit pachtoune en développant un ensemble de données nommé Pashto Handwritten Text Imagebase (PHTI). Le PHTI est créé en recueillant des échantillons manuscrits de divers genres de la langue pachtoune, y compris la poésie, la religion, les nouvelles, les articles, les romans, le sport, la culture et les nouvelles. L'ensemble de données se compose de 4 000 images numérisées, écrites par 400 écrivains, dont 200 hommes et 200 femmes. Ces 4 000 images sont ensuite segmentées en 36 082 images de ligne de texte. Chaque image de ligne de texte est annotée/ transcrite avec des codecs UTF-8. L'ensemble de données peut être utilisé pour de nombreuses applications basées sur l'apprentissage profond, notamment la reconnaissance de texte, la détection de biais, la classification par sexe et la classification par groupes d'âge. El análisis de imágenes de documentos (DIA) es una de las áreas de investigación de la inteligencia artificial (IA) que convierte las imágenes de los documentos en códigos legibles por máquina. En los sistemas DIA, el reconocimiento óptico de caracteres (OCR) desempeña un papel clave en la digitalización de imágenes de documentos. La salida de un sistema OCR se utiliza además en muchas aplicaciones, como el procesamiento del lenguaje natural (PNL), el análisis de sentimientos, el reconocimiento del habla y los servicios de traducción. Sin embargo, los conjuntos de datos estándar son un requisito esencial para el desarrollo, la evaluación y la comparación de diferentes técnicas de reconocimiento de texto. El pastún es uno de esos lenguajes de bajos recursos que carece de disponibilidad con respecto al conjunto de datos estándar de texto escrito a mano. Por lo tanto, este documento aborda la falta de disponibilidad de un conjunto de datos estándar para el texto escrito a mano en pastún mediante el desarrollo de un conjunto de datos llamado Pashto Handwritten Text Imagebase (PHTI). El PHTI se crea mediante la recopilación de muestras manuscritas de diversos géneros de la lengua pashto, como poesía, religión, cuentos, artículos, novelas, deportes, cultura y noticias. El conjunto de datos consta de 4.000 imágenes escaneadas, escritas por 400 escritores, incluidos 200 hombres y 200 mujeres. Estas 4.000 imágenes se segmentan en 36.082 imágenes de líneas de texto. Cada imagen de línea de texto se anota/ transcribe con códecs UTF-8. El conjunto de datos se puede utilizar para muchas aplicaciones basadas en el aprendizaje profundo, como el reconocimiento de texto, la detección de sesgos, la clasificación de género y la clasificación de grupos de edad.

Languages

Licenses

Similaires