The success of machine learning for automatic speech processing has raised the need for large scale datasets. However, collecting such data is often a challenging task as it implies significant investment involving time and money cost. In this paper, we devise a recipe for building largescale Speech Corpora by harnessing Web resources namely YouTube, other Social Media, Online Radio and TV. We illustrate our methodology by building KALAM'DZ, An Arabic Spoken corpus dedicated to Algerian dialectal varieties. The preliminary version of our dataset covers all major Algerian dialects. In addition, we make sure that this material takes into account numerous aspects that foster its richness. In fact, we have targeted various speech topics. Some automatic and manual annotations are provided. They gather useful information related to the speakers and sub-dialect information at the utterance level. Our corpus encompasses the 8 major Algerian Arabic sub-dialects with 4881 speakers and more than 104.4 hours segmented in utterances of at least 6 s. أدى نجاح التعلم الآلي للمعالجة التلقائية للكلام إلى زيادة الحاجة إلى مجموعات بيانات واسعة النطاق. ومع ذلك، غالبًا ما يكون جمع هذه البيانات مهمة صعبة لأنها تنطوي على استثمار كبير ينطوي على تكلفة الوقت والمال. في هذه الورقة، نبتكر وصفة لبناء مؤسسات خطاب واسعة النطاق من خلال تسخير موارد الويب وهي YouTube ووسائل التواصل الاجتماعي الأخرى والراديو عبر الإنترنت والتلفزيون. نحن نوضح منهجيتنا من خلال بناء KALAM'DZ، مجموعة منطوقة باللغة العربية مخصصة لأصناف اللهجات الجزائرية. تغطي النسخة الأولية من مجموعة البيانات الخاصة بنا جميع اللهجات الجزائرية الرئيسية. بالإضافة إلى ذلك، نتأكد من أن هذه المادة تأخذ في الاعتبار العديد من الجوانب التي تعزز ثرائها. في الواقع، لقد استهدفنا مواضيع خطاب مختلفة. يتم توفير بعض التعليقات التوضيحية التلقائية واليدوية. يجمعون معلومات مفيدة تتعلق بالمتحدثين ومعلومات اللهجة الفرعية على مستوى النطق. تشمل مجموعتنا اللهجات الفرعية الثمانية الرئيسية للغة العربية الجزائرية مع 4881 متحدثًا وأكثر من 104.4 ساعة مقسمة بأقوال لا تقل عن 6 ثوانٍ. Le succès de l'apprentissage automatique pour le traitement automatique de la parole a soulevé le besoin d'ensembles de données à grande échelle. Cependant, la collecte de ces données est souvent une tâche difficile car elle implique un investissement important en temps et en argent. Dans cet article, nous concevons une recette pour créer des corps de parole à grande échelle en exploitant des ressources Web, à savoir YouTube, d'autres médias sociaux, la radio et la télévision en ligne. Nous illustrons notre méthodologie en construisant KALAM'DZ, un corpus arabe parlé dédié aux variétés dialectales algériennes. La version préliminaire de notre ensemble de données couvre tous les principaux dialectes algériens. De plus, nous veillons à ce que ce matériel prenne en compte de nombreux aspects qui favorisent sa richesse. En fait, nous avons ciblé divers sujets de discours. Certaines annotations automatiques et manuelles sont fournies. Ils recueillent des informations utiles liées aux locuteurs et des informations de sous-dialectes au niveau de l'énoncé. Notre corpus englobe les 8 principaux sous-dialectes arabes algériens avec 4881 locuteurs et plus de 104,4 heures segmentées en énoncés d'au moins 6 s. El éxito del aprendizaje automático para el procesamiento automático del habla ha aumentado la necesidad de conjuntos de datos a gran escala. Sin embargo, la recopilación de dichos datos suele ser una tarea difícil, ya que implica una inversión significativa que implica tiempo y dinero. En este documento, ideamos una receta para construir corpus de habla a gran escala aprovechando los recursos web, es decir, YouTube, otras redes sociales, radio y televisión en línea. Ilustramos nuestra metodología construyendo KALAM 'DZ, un corpus hablado en árabe dedicado a las variedades dialectales argelinas. La versión preliminar de nuestro conjunto de datos cubre todos los principales dialectos argelinos. Además, nos aseguramos de que este material tenga en cuenta numerosos aspectos que fomentan su riqueza. De hecho, nos hemos centrado en varios temas de habla. Se proporcionan algunas anotaciones automáticas y manuales. Recopilan información útil relacionada con los hablantes e información de subdialecto a nivel de expresión. Nuestro corpus abarca los 8 principales subdialectos del árabe argelino con 4881 hablantes y más de 104,4 horas segmentadas en expresiones de al menos 6 s.