Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Diagnostic Interview Corpus - Translation

Domaine:

natural language processinghealthcare

Type de record:

dataset
Créateur:
BouGerMutSpe
Éditeur:
[3aBouOrmMut
Éditeur:
Uni
Hôte:avatar
The Diagnostic Interview Corpus is a multilingual dataset of 12,754 French medical consultation sentences (questions and instructions) with translations into 12 languages and associated UMLS-based semantic glosses. It supports research on low-resource medical machine translation, semantic representation, and pictograph generation. Languages - Source: French - Targets (in translations.csv): Albanian, Modern Standard Arabic, Tunisian Arabic, Moroccan Arabic, Algerian Arabic, Dari (Afghan Persian), Farsi (Iranian Persian), Russian, English, Spanish, Tigrinya, Ukrainian - Semantic gloss (in translations.csv): French sentences aligned with UMLS glosses (concept sequences + functional tokens). - Paraphrases (in paraphrases.csv): French paraphrases aligned with the corresponding French source sentences, generated through a grammar-based approach to ensure controlled syntactic variation Domains and registers - Medical consultations - Questions and instructions (e.g., symptom checks, treatment directives) - Categories by body region (e.g., head, chest, abdomen) Features - Parallel multilingual translations created and adapted with clinical experts - Semantic gloss layer (UMLS CUIs + functional tokens) for pictograph generation - Patient-centered simplifications and cultural adaptations to improve comprehension Example French: Avez-vous des nausées ou des vomissements ? English: Do you have nausea or vomiting? UMLS gloss: You | Nausea | or – article | Vomiting | Question Intended Use - Low-resource multilingual MT research - Semantic representation learning (UMLS-based) - Pictograph translation systems for patients with limited health literacy - Evaluation of medical-domain MT beyond surface-level accuracy Acknowledgements This corpus was developed in the context of the BabelDr and PictoDr projects at the University of Geneva in collaboration with Geneva University Hospitals.This work is part of the PROPICTO project, funded by the Swiss National Science Foundation (N°197864) and the French National Research Agency (ANR-20-CE93-0005). This project also received funding by the ”Fondation Privée des Hôpitaux Universitaires de Genève”.

Visit

doi.orgyareta.unige.ch

Languages

Arabic, Algerian SpokenArabic, Moroccan SpokenArabic, Tunisian SpokenTigrigna

Tags

low resource machine translationmedical dialoguesmedical domainmedical questionnairessemantic glossUMLSStandard Modern ArabicAlbanianMoroccan ArabicTunisian Arabic+9

Similaires

Tanzil Quran Translation CorpusMaasai-English Translation CorpusBurushaski-English Speech Translation CorpusAmharic-English-Machine-Translation-Corpusmachine-translation-corpus-amharic-englishMarsPanther/Amharic-English-Machine-Translation-Corpus

Tanzil Quran Translation Corpus

Machine translation, religious NLP research, cross-lingual modeling Notes / challenges: Contains 60

Maasai-English Translation Corpus

Parallel English↔Maasai translation pairs for low-resource MT, language preservation, and culturally

Burushaski-English Speech Translation Corpus

The Burushaski Speech–English Parallel Corpus is a community-driven language resource developed to s

Amharic-English-Machine-Translation-Corpus

Amharic English Machine Translation Corpus prepared through website crawelling and custom preprocessing. This is a corpus made in effort to make amaharic english parallel data avilable for anyone who wants to deal with machine translation.

machine-translation-corpus-amharic-english

MarsPanther/Amharic-English-Machine-Translation-Corpus

Amharic English Machine Translation Corpus prepared through website crawelling and custom preprocess