Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

CrossSum: Beyond English-Centric Cross-Lingual Abstractive Text Summarization for 1500+ Language Pairs

Domaine:

natural language processing

Type de record:

paper
We present CrossSum, a large-scale dataset comprising 1.65 million cross-lingual article-summary samples in 1500+ language-pairs constituting 45 languages. We use the multilingual XL-Sum dataset and align identical articles written in different languages via cross-lingual retrieval using a language-agnostic representation model. We propose a multi-stage data sampling algorithm and fine-tune mT5, a multilingual pretrained model, with explicit cross-lingual supervision with CrossSum and introduce a new metric for evaluating cross-lingual summarization. Results on established and our proposed metrics indicate that models fine-tuned on CrossSum outperforms summarization+translation baselines, even when the source and target language pairs are linguistically distant. To the best of our knowledge, CrossSum is the largest cross-lingual summarization dataset and also the first-ever that does not rely on English as the pivot language. We are releasing the dataset, alignment and training scripts, and the models to spur future research on cross-lingual abstractive summarization.

Visit

arxiv.org

Connected records

dataset

Tasks

summarizationnatural language generation

Languages

HausaIgboKoOromoPidgin, NigerianRundiSomaliSwahiliTigrignaYoruba

Tags

CrossSum

Similaires

Amharic Abstractive Text SummarizationUnsupervised Abstractive Summarization of Bengali Text DocumentsAbstractive Text Summarization for Contemporary Sanskrit Prose: Issues and ChallengesLEMMA-ROUGE: An Evaluation Metric for Arabic Abstractive Text SummarizationAbstractive Tigrigna Text Summarization using Deep Learning ApproachEnhanced model for abstractive Arabic text summarization using natural language generation and named entity recognition

Amharic Abstractive Text Summarization

Text Summarization is the task of condensing long text into just a handful of sentences. Many approa

Unsupervised Abstractive Summarization of Bengali Text Documents

Abstractive summarization systems generally rely on large collections of document-summary pairs. How

Abstractive Text Summarization for Contemporary Sanskrit Prose: Issues and Challenges

This thesis presents Abstractive Text Summarization models for contemporary Sanskrit prose. The firs

LEMMA-ROUGE: An Evaluation Metric for Arabic Abstractive Text Summarization

High morphological languages are characterized by complex inflections and derivations, which can pre

Abstractive Tigrigna Text Summarization using Deep Learning Approach

Text summarization has become essential due to the vast amounts of text data shared online. It is th

Enhanced model for abstractive Arabic text summarization using natural language generation and named entity recognition

Abstract With the rise of Arabic digital content, effective summarization methods are es