Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

CAFE: Algerian Arabic, French, and English Code-Switched Conversational Speech Dataset

Domaine:

natural language processing

Type de record:

dataset
Créateur:
LacAbbOukEl
Éditeur:
Zenodo
Hôte:avatar
The CAFE dataset (Code-switching Algerian French English) addresses the lack of publicly available resources capturing spontaneous code-switching between Algerian Arabic (Darja), French, and English. Spanning over 37 hours of real-world, in vivo human–human dialogue from more than 100 speakers, it reflects Algeria’s rich sociolinguistic landscape through naturally occurring conversational features such as code-switching points, overlapping speech, non-lexical events (e.g., laughter, fillers, ambient noise), and dialectal variation. CAFE supports research in automatic speech recognition (ASR), dialect identification, and multilingual NLP for low-resource settings. Annotations were based on Latin script for French and English, while Arabic script was applied for Algerian Dialect and MSA. The dataset consists of three main subsets: cafe-small/Contains annotated audio clips featuring natural conversations. audio/: Mono-channel WAV files (16 kHz, 16-bit PCM). transcripts_raw/: A CSV file aggregating raw transcriptions for all files. transcripts_ZAEBUC/:One JSON file with enriched annotations using the ZAEBUC-Spoken format for each file. (including dialect intensity and language switching details). cafe-large/Includes a larger volume of audio clips with pseudo-labels generated using Whisper-based models. audio/: Mono-channel WAV files (16 kHz, 16-bit PCM). pseudo_labels/: CSV files containing pseudo-transcriptions per audio file. CAFE-small-no-overlap/A curated subset of cafe-small, filtered to remove speaker or content overlap for benchmarking or experimentation. audio/: Mono-channel WAV files (16 kHz, 16-bit PCM). transcripts_raw/: CSV files where each row includes the filename and its pseudo-transcription.  

Visit

doi.orgzenodo.org

Tasks

automatic speech recognitioncode switchinglanguage identificationspeech processing

Languages

Arabic, Algerian Spoken

Licenses

Creative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similaires

CAFE: Spontaneous code-switching speech dataset in Algerian dialect, French and EnglishCAFE A Novel Code switching Dataset for Algerian Dialect French and EnglishChichewa-English Code-Switched Speech DatasetEnglish-IsiZulu Code-Switched Speech Recognition DatasetAddressing Code-Switching in French/Algerian Arabic SpeechNeural-based NLP systems for code-switched Arabic-English speech

CAFE: Spontaneous code-switching speech dataset in Algerian dialect, French and English

CAFE A Novel Code switching Dataset for Algerian Dialect French and English

The paper introduces and publicly releases (Data download link available after acceptance) CAFE -- t

Chichewa-English Code-Switched Speech Dataset

A speech dataset containing 247 audio recordings of Chichewa-English code-switched phrases. Code-swi

English-IsiZulu Code-Switched Speech Recognition Dataset

Dataset for semi-supervised acoustic and language model training for English-isiZulu code-switched s

Addressing Code-Switching in French/Algerian Arabic Speech

International audience This study focuses on code-switching (CS) in French/Algerian A

Neural-based NLP systems for code-switched Arabic-English speech

In the ever-evolving language landscape, code-switching has emerged as an interesting linguistic phe