Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Lacuna PII Multilingual Text Dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Lab
Éditeur:
Lab
Éditeur:
Har
Hôte:avatar
The Lacuna PII Multilingual Text Dataset, created by Makerere Artificial Intelligence Lab in collaboration with Marconi Lab and Clear Global, contains annotated sentences with personally identifiable information (PII) in Luganda, Lumasaba, Hausa, and Kanuri. This dataset supports tasks such as Named Entity Recognition, Text Classification, and Privacy-Preserving Data Analysis. It comprises 4000 Luganda sentences, 5000 Lumasaba sentences, 3000 Kanuri sentences, and 3000 Hausa sentences

Visit

doi.orgdataverse.harvard.edu

Tasks

information extractionnamed entity recognitiontext classification

Languages

GandaHausaKanembuKanuri, MangaKanuri, Yerwa

Tags

Computer and Information ScienceOtherPerson Identifiable Information

Licenses

info:eu-repo/semantics/openAccessCreative Commons Zero v1.0 Universalhttps://creativecommons.org/publicdomain/zero/1.0/legalcode

Similaires

TaTa: A Multilingual Table-to-Text Dataset for African LanguagesTaxi1500: A Dataset for Multilingual Text Classification in 1500 LanguagesTaTA: A Multilingual Table-to-Text Dataset for African LanguagesA Multilingual & Multimodal Text and Image Corpus Dataset for Political MisinformationMultilingual Text RepresentationPreserving privacy and avoiding gender bias of AI systems in Luganda, Lumasaba, Hausa, and Kanuri - The Lacuna personally identifiable information Text Dataset

TaTa: A Multilingual Table-to-Text Dataset for African Languages

Existing data-to-text generation datasets are mostly limited to English. To address this lack of data, we create Table-to-Text in African languages (TaTa), the first large multilingual table-to-text dataset with a focus on African languages. We created TaTa by tran

Taxi1500: A Dataset for Multilingual Text Classification in 1500 Languages

While broad-coverage multilingual natural language processing tools have been developed, a significa

TaTA: A Multilingual Table-to-Text Dataset for African Languages

TaTA (Table-to-Text in African languages) is the first large multilingual table-to-text datasets with a focus on African languages. The dataset is parallel and covers nine languages, eight of which are spoken in Africa: Arabic, English, French, Hausa, Igbo, Portugu

A Multilingual & Multimodal Text and Image Corpus Dataset for Political Misinformation

Our database is a richly annotated multimodal database designed to facilitate strong fake-news detec

Multilingual Text Representation

Modern NLP breakthrough includes large multilingual models capable of performing tasks across more t

Preserving privacy and avoiding gender bias of AI systems in Luganda, Lumasaba, Hausa, and Kanuri - The Lacuna personally identifiable information Text Dataset

The Lacuna PII Multilingual Text Dataset contains annotated sentences with personally identifiable