Logo Lanfrica

CrossSum

Domaine:

natural language processing

Type de record:

dataset
Créateur:
cse
Hôte:
We present CrossSum, a large-scale dataset comprising 1.70 million cross-lingual article summary samples in 1500+ language-pairs constituting 45 languages. We use the multilingual XL-Sum dataset and align identical articles written in different languages via crosslingual retrieval using a language-agnostic representation model.