Contemporary works on abstractive text summarization have focused primarily on highresource languages like English, mostly due to the limited availability of datasets for low/midresource ones.In this work, we present XL-Sum, a comprehensive and diverse dataset comprising 1 million professionally annotated article-summary pairs from BBC, extracted using a set of carefully designed heuristics.The dataset covers 44 languages ranging from low to high-resource, for many of which no public dataset is currently available.XL-Sum is highly abstractive, concise, and of high quality, as indicated by human and intrinsic evaluation.We fine-tune mT5, a state-of-theart pretrained multilingual model, with XL-Sum and experiment on multilingual and lowresource summarization tasks.XL-Sum induces competitive results compared to the ones obtained using similar monolingual datasets: we show higher than 11 ROUGE-2 scores on 10 languages we benchmark on, with some of them exceeding 15, as obtained by multilingual training.Additionally, training on low-resource languages individually also provides competitive performance.To the best of our knowledge, XL-Sum is the largest abstractive summarization dataset in terms of the number of samples collected from a single source and the number of languages covered.We are releasing our dataset and models to encourage future research on multilingual abstractive summarization.The resources can be found at
github. ركزت الأعمال المعاصرة حول تلخيص النص التجريدي في المقام الأول على اللغات عالية الموارد مثل اللغة الإنجليزية، ويرجع ذلك في الغالب إلى محدودية توافر مجموعات البيانات الخاصة باللغات منخفضة/متوسطة الموارد. في هذا العمل، نقدم XL - Sum، وهي مجموعة بيانات شاملة ومتنوعة تضم مليون زوج من ملخصات المقالات المشروحة بشكل احترافي من BBC، مستخرجة باستخدام مجموعة من الاستدلالات المصممة بعناية. تغطي مجموعة البيانات 44 لغة تتراوح من منخفضة إلى عالية الموارد، والتي لا تتوفر بالنسبة للعديد منها مجموعة بيانات عامة حاليًا. XL - Sum تجريدية وموجزة وعالية الجودة، كما هو موضح في التقييم البشري والجوهري. نقوم بضبط mT5، وهو نموذج متعدد اللغات مدرب مسبقًا، مع XL - Sum وتجربة على مهام تلخيص متعددة اللغات ومنخفضة الموارد. XL - Sum يحفز نتائج تنافسية مقارنة بتلك التي تم الحصول عليها باستخدام مجموعات بيانات أحادية اللغة مماثلة: نظهر أعلى من 11 درجة ROUGE -2 على 10 لغات نقيسها، مع تجاوز بعضها 15، كما تم الحصول عليها من خلال التدريب متعدد اللغات. بالإضافة إلى ذلك، يوفر التدريب على اللغات منخفضة الموارد بشكل فردي أيضًا أداءً تنافسيًا. على حد علمنا، XL - Sum هي أكبر مجموعة بيانات تلخيص تجريدية من حيث عدد العينات التي تم جمعها من مصدر واحد وعدد اللغات المشمولة. نحن نصدر مجموعة البيانات والنماذج الخاصة بنا لتشجيع البحث المستقبلي حول التلخيص التجريدي متعدد اللغات. يمكن العثور على الموارد على https :// github. Les travaux contemporains sur la synthèse de texte abstraite se sont concentrés principalement sur les langues à ressources élevées comme l'anglais, principalement en raison de la disponibilité limitée d'ensembles de données pour les ressources faibles/moyennes. Dans ce travail, nous présentons XL-Sum, un ensemble de données complet et diversifié comprenant 1 million de paires article-sommaire annotées professionnellement de la BBC, extraites à l'aide d'un ensemble d'heuristiques soigneusement conçues. L'ensemble de données couvre 44 langues allant des ressources faibles aux ressources élevées, pour lesquelles aucun ensemble de données public n'est actuellement disponible.XL-Sum est très abstrait, concis et de haute qualité, comme indiqué par l'évaluation humaine et intrinsèque.Nous affinons mT5, un modèle multilingue pré-entraîné à la pointe de la technologie, avec XL-Sum et expérimentation sur des tâches de synthèse multilingues et à faibles ressources.XL-Sum induit des résultats compétitifs par rapport à ceux obtenus à l'aide d'ensembles de données monolingues similaires : nous affichons des scores supérieurs à 11 ROUGE-2 sur 10 langues que nous comparons, avec certains d'entre eux dépassant 15, tels qu'obtenus par une formation multilingue.En outre, la formation sur les langues à faibles ressources offre également des performances compétitives individuelles.À notre connaissance, XL-Sum est le plus grand ensemble de données de synthèse abstractive en termes de nombre d'échantillons collectés à partir d'un source unique et le nombre de langues couvertes. Nous publions notre ensemble de données et nos modèles pour encourager les recherches futures sur la synthèse abstraite multilingue. Les ressources peuvent être trouvées sur https ://github. Los trabajos contemporáneos sobre el resumen de textos abstractos se han centrado principalmente en idiomas de altos recursos como el inglés, principalmente debido a la disponibilidad limitada de conjuntos de datos para los de bajos/medianos recursos. En este trabajo, presentamos XL-Sum, un conjunto de datos completo y diverso que comprende 1 millón de pares de artículos y resúmenes anotados profesionalmente de la BBC, extraídos utilizando un conjunto de heurísticas cuidadosamente diseñadas. El conjunto de datos cubre 44 idiomas que van de bajos a altos recursos, para muchos de los cuales actualmente no hay un conjunto de datos público disponible. XL-Sum es altamente abstracto, conciso y de alta calidad, como lo indica la evaluación humana e intrínseca. Ajustamos mT5, un modelo multilingüe preentrenado de vanguardia, con XL-Sum y experimentamos con tareas de resumen multilingües y de bajos recursos. XL-Sum induce resultados competitivos en comparación con los obtenidos utilizando conjuntos de datos monolingües similares: mostramos puntuaciones superiores a 11 ROUGE-2 en 10 idiomas que comparamos, y algunos de ellos superan los 15, obtenidos mediante capacitación multilingüe. Además, la capacitación en idiomas de bajos recursos individualmente también proporciona un rendimiento competitivo. Hasta donde sabemos, XL-Sum es el mayor conjunto de datos de resumen abstractivo en términos del número de muestras recopiladas de un fuente única y el número de idiomas cubiertos. Estamos publicando nuestro conjunto de datos y modelos para fomentar futuras investigaciones sobre el resumen abstractivo multilingüe. Los recursos se pueden encontrar en
github.