Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

ReceiptSense: Beyond Traditional OCR -- A Dataset for Receipt Understanding

Domaine:

natural language processing

Type de record:

paperdataset
Créateur:
AbdMouAbdKas
Hôte:avatar
Multilingual OCR and information extraction from receipts remains challenging, particularly for complex scripts like Arabic. We introduce \dataset, a comprehensive dataset designed for Arabic-English receipt understanding comprising 20,000 annotated receipts from diverse retail settings, 30,000 OCR-annotated images, and 10,000 item-level annotations, and a new Receipt QA subset with 1265 receipt images paired with 40 question-answer pairs each to support LLM evaluation for receipt understanding. The dataset captures merchant names, item descriptions, prices, receipt numbers, and dates to support object detection, OCR, and information extraction tasks. We establish baseline performance using traditional methods (Tesseract OCR) and advanced neural networks, demonstrating the dataset's effectiveness for processing complex, noisy real-world receipt layouts. Our publicly accessible dataset advances automated multilingual document processing research (see github.com ).

Visit

arxiv.org

Tasks

optical character recognitioncomputer vision

Tags

Computer Vision and Pattern RecognitionComputation and Language

Similaires

A Dataset of Wolof Ajami Manuscripts for HTR and OCRtaqacuct/kab-ocr-datasetmarconilabmak/luganda-ocr-datasetHassaniya Stories OCR DatasetBeijuka/luganda-ocr-datasetfidel-amharic-ocr-dataset

A Dataset of Wolof Ajami Manuscripts for HTR and OCR

taqacuct/kab-ocr-dataset

Dataset synthétique pour entraîner un modèle OCR sur le kabyle. images/ : contiendra les images gén

marconilabmak/luganda-ocr-dataset

This dataset contains segmented line-level images and corresponding transcriptions in Luganda, a low

Hassaniya Stories OCR Dataset

Image-to-text OCR pairs extracted from a Hassaniya Arabic stories corpus. Each row couples an image

Beijuka/luganda-ocr-dataset

fidel-amharic-ocr-dataset

Large-Scale Sentence Level Amharic OCR Dataset