Abstract With the success of large-scale pre-training and multilingual modeling in Natural Language Processing (NLP), recent years have seen a proliferation of large, Web-mined text datasets covering hundreds of languages. We manually audit the quality of 205 language-specific corpora released with five major public datasets (CCAligned, ParaCrawl, WikiMatrix, OSCAR, mC4). Lower-resource corpora have systematic issues: At least 15 corpora have no usable text, and a significant fraction contains less than 50% sentences of acceptable quality. In addition, many are mislabeled or use nonstandard/ambiguous language codes. We demonstrate that these issues are easy to detect even for non-proficient speakers, and supplement the human audit with automatic analyses. Finally, we recommend techniques to evaluate and improve multilingual corpora and discuss potential risks that come with low-quality data releases. الخلاصة مع نجاح التدريب المسبق واسع النطاق والنمذجة متعددة اللغات في معالجة اللغات الطبيعية (NLP)، شهدت السنوات الأخيرة انتشارًا لمجموعات بيانات نصية كبيرة مستخرجة من الويب تغطي مئات اللغات. نقوم يدويًا بتدقيق جودة 205 مجموعة لغوية محددة تم إصدارها مع خمس مجموعات بيانات عامة رئيسية (CCAligned و ParaCrawl و WikiMatrix و OSCAR و mC4). لدى المجموعات منخفضة الموارد مشكلات منهجية: على الأقل 15 مجموعة ليس لديها نص قابل للاستخدام، ويحتوي جزء كبير منها على أقل من 50 ٪ من الجمل ذات الجودة المقبولة. بالإضافة إلى ذلك، يتم تصنيف العديد منهم بشكل خاطئ أو يستخدمون رموزًا لغوية غير قياسية/غامضة. نثبت أن هذه المشكلات يسهل اكتشافها حتى بالنسبة للمتحدثين غير الأكفاء، ونكمل التدقيق البشري بالتحليلات التلقائية. أخيرًا، نوصي بتقنيات لتقييم وتحسين النصوص متعددة اللغات ومناقشة المخاطر المحتملة التي تأتي مع إصدارات البيانات منخفضة الجودة. Résumé Avec le succès de la préformation à grande échelle et de la modélisation multilingue en traitement du langage naturel (PNL), les dernières années ont vu une prolifération de grands ensembles de données textuelles exploitées sur le Web couvrant des centaines de langues. Nous auditons manuellement la qualité de 205 corpus spécifiques à une langue publiés avec cinq ensembles de données publics majeurs (CCAligned, ParaCrawl, WikiMatrix, OSCAR, mC4). Les corpus de ressources inférieures ont des problèmes systématiques : au moins 15 corpus n'ont pas de texte utilisable, et une fraction importante contient moins de 50 % de phrases de qualité acceptable. En outre, beaucoup sont mal étiquetés ou utilisent des codes de langue non standard/ambigus. Nous démontrons que ces problèmes sont faciles à détecter même pour les locuteurs non performants, et complétons l'audit humain par des analyses automatiques. Enfin, nous recommandons des techniques pour évaluer et améliorer les corpus multilingues et discuter des risques potentiels liés à la publication de données de mauvaise qualité. Resumen Con el éxito de la formación previa a gran escala y el modelado multilingüe en el procesamiento del lenguaje natural (PNL), en los últimos años ha habido una proliferación de grandes conjuntos de datos de texto extraídos de la web que cubren cientos de idiomas. Auditamos manualmente la calidad de 205 corpus específicos del idioma publicados con cinco conjuntos de datos públicos principales (CCAligned, ParaCrawl, WikiMatrix, OSCAR, mC4). Los corpus de bajos recursos tienen problemas sistemáticos: al menos 15 corpus no tienen texto utilizable y una fracción significativa contiene menos del 50% de oraciones de calidad aceptable. Además, muchos están mal etiquetados o usan códigos de lenguaje no estándar/ambiguos. Demostramos que estos problemas son fáciles de detectar incluso para oradores no competentes, y complementamos la auditoría humana con análisis automáticos. Finalmente, recomendamos técnicas para evaluar y mejorar los corpus multilingües y discutir los riesgos potenciales que conlleva la publicación de datos de baja calidad.