Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Using Punkt for Sentence Segmentation in non-Latin Scripts: Experiments on Kurdish (Sorani) Texts

Domaine:

natural language processing

Type de record:

paperdataset
Créateur:
AbdHas
Hôte:avatar
Segmentation is a fundamental step for most Natural Language Processing tasks. The Kurdish language is a multi-dialect, under-resourced language which is written in different scripts. The lack of various segmented corpora is one of the major bottlenecks in Kurdish language processing. We used Punkt, an unsupervised machine learning method, to segment a Kurdish corpus of Sorani dialect, written in Persian-Arabic script. According to the literature, studies on using Punkt on non-Latin data are scanty. In our experiment, we achieved an F1 score of 91.10% and had an Error Rate of 16.32%. The high Error Rate is mainly due to the situation of abbreviations in Kurdish and partly because of ordinal numerals. The data is publicly available at github.com KTC-Segmented for non-commercial use under the CC BY-NC-SA 4.0 licence. Accepted for AfricaNLP Workshop at ICLR 2020

Visit

arxiv.org

Tasks

sentence segmentation

Tags

Computation and Language

Similaires

Automatic Text Summarization (ATS) for Research Documents in Sorani KurdishKHLD: A Large-Scale Benchmark of the Kurdish Handwritten Lines Dataset for Low-Resource Central Kurdish (Sorani)Kurdish (Sorani) Speech to Text: Presenting an Experimental DatasetUsing Contextual Information for Sentence-level Morpheme SegmentationKurdishMCQ: A multiple-choice question dataset for the Kurdish language (Sorani dialect)Named Entity Recognition for the Kurdish Sorani Language: Dataset Creation and Comparative Analysis

Automatic Text Summarization (ATS) for Research Documents in Sorani Kurdish

Extracting concise information from scientific documents aids learners, researchers, and practitione

KHLD: A Large-Scale Benchmark of the Kurdish Handwritten Lines Dataset for Low-Resource Central Kurdish (Sorani)

The Kurdish Handwritten Lines Dataset (KHLD) is a large-scale image dataset aiming to facilitate han

Kurdish (Sorani) Speech to Text: Presenting an Experimental Dataset

We present an experimental dataset, Basic Dataset for Sorani Kurdish Automatic Speech Recognition (B

Using Contextual Information for Sentence-level Morpheme Segmentation

Recent advancements in morpheme segmentation primarily emphasize word-level segmentation, often negl

KurdishMCQ: A multiple-choice question dataset for the Kurdish language (Sorani dialect)

This dataset is the first large-scale, publicly available collection of multiple-choice questions in

Named Entity Recognition for the Kurdish Sorani Language: Dataset Creation and Comparative Analysis

This work contributes towards balancing the inclusivity and global applicability of natural language