Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Revisiting non-English Text Simplification: A Unified Multilingual Benchmark

Domaine:

natural language processing

Type de record:

paperdataset
Créateur:
Ryan, Michael J.NaoXu,
Hôte:avatar
Recent advancements in high-quality, large-scale English resources have pushed the frontier of English Automatic Text Simplification (ATS) research. However, less work has been done on multilingual text simplification due to the lack of a diverse evaluation benchmark that covers complex-simple sentence pairs in many languages. This paper introduces the MultiSim benchmark, a collection of 27 resources in 12 distinct languages containing over 1.7 million complex-simple sentence pairs. This benchmark will encourage research in developing more effective multilingual text simplification models and evaluation metrics. Our experiments using MultiSim with pre-trained multilingual language models reveal exciting performance improvements from multilingual training in non-English settings. We observe strong performance from Russian in zero-shot cross-lingual transfer to low-resource languages. We further show that few-shot prompting with BLOOM-176b achieves comparable quality to reference simplifications outperforming fine-tuned models in most languages. We validate these findings through human evaluation. Accepted to ACL 2023 main conference

Visit

arxiv.org

Tasks

natural language generation

Tags

Computation and LanguageArtificial Intelligence

Similaires

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural IntelligenceSEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast AsiaPedagogy Benchmark - MultilingualTUMLU: A Unified and Native Language Understanding Benchmark for Turkic LanguagesArabic Word-level Readability Visualization for Assisted Text SimplificationMMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

Despite rapid advances in multimodal large language models, agricultural applications remain constra

SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia

Multilingual document and scene text understanding plays an important role in applications such as s

Pedagogy Benchmark - Multilingual

A multilingual translation of the AI-for-Education/pedagogy-benchmark dataset into African languages

TUMLU: A Unified and Native Language Understanding Benchmark for Turkic Languages

Being able to thoroughly assess massive multi-task language understanding (MMLU) capabilities is ess

Arabic Word-level Readability Visualization for Assisted Text Simplification

This demo paper presents a Google Docs add-on for automatic Arabic word-level readability visualizat

MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation

End-to-end text-image machine translation (TIMT), which directly translates textual content in image