Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Nigerian Academic Writing Corpus: Pre-AI Benchmark for AI-Generated Text Detection

Domaine:

natural language processing

Type de record:

dataset
Créateur:
Aki
Éditeur:
Men
Hôte:avatar
A curated corpus of pre-AI era (2005–2022) Nigerian academic writing paired with AI-generated equivalents for training and evaluating AI-generated text detectors calibrated to Nigerian English. The dataset contains two components: (1) 4,239 authentic academic texts extracted from Covenant University and University of Ibadan open-access repositories, spanning theses, dissertations, journal articles, and student projects across multiple disciplines; and (2) 6,000 AI-generated academic essays produced by six major large language models (GPT-4o-mini, GPT-4o, Claude Sonnet, Gemini 2.5 Flash, Grok 3 Mini, and DeepSeek Chat) using topics drawn from the human corpus. All human texts predate the launch of ChatGPT (November 2022), ensuring zero AI contamination in the baseline. The paired structure enables controlled experiments for binary classification (human vs AI), multi-class source attribution (identifying which LLM generated a text), and cross-dialectal evaluation of AI detection systems on African English.

Visit

doi.orgdata.mendeley.com

Tasks

text classification

Tags

Natural Language ProcessingGenerative Artificial Intelligence

Licenses

info:eu-repo/semantics/openAccessCreative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similaires

ALHD: A Large-Scale and Multigenre Benchmark Dataset for Arabic LLM-Generated Text DetectionCounter Turing Test ($CT^2$): Investigating AI-Generated Text Detection for Hindi -- Ranking LLMs based on Hindi AI Detectability Index ($ADI_{hi}$)Influence of Grammarly AI Writing Tools on Undergraduate Students’ Perceived Academic Writing Performance in Selected Northern Nigerian UniversitiesIdentifying Text Classification Failures in Multilingual AI-Generated ContentYarnGPT - Nigerian Text-to-Speech AIstem-content-ai-project/swahili-text-corpus

ALHD: A Large-Scale and Multigenre Benchmark Dataset for Arabic LLM-Generated Text Detection

We introduce ALHD, the first large-scale comprehensive Arabic dataset explicitly designed to disting

Counter Turing Test ($CT^2$): Investigating AI-Generated Text Detection for Hindi -- Ranking LLMs based on Hindi AI Detectability Index ($ADI_{hi}$)

The widespread adoption of Large Language Models (LLMs) and awareness around multilingual LLMs have

Influence of Grammarly AI Writing Tools on Undergraduate Students’ Perceived Academic Writing Performance in Selected Northern Nigerian Universities

The increasing adoption of artificial intelligence (AI) writing tools has transformed academic writi

Identifying Text Classification Failures in Multilingual AI-Generated Content

With the rising popularity of generative AI tools, the nature of apparent classification failures by

YarnGPT - Nigerian Text-to-Speech AI

Generate high-quality, authentic Nigerian text-to-speech audio for your podcasts, videos, and applications.

stem-content-ai-project/swahili-text-corpus

This dataset contains a synthetic Swahili text corpus designed for training Text-to-Speech (TTS) mod