In this paper we describe our work towards building a generic framework for both multimodal embedding and multi-label binary classification tasks, while participating in task 5 (Multimedia Automatic Misogyny Identification) of SemEval 2022 competition.Since pretraining deep models from scratch is a resource and data hungry task, our approach is based on three main strategies.We combine different state-of-the-art architectures to capture a wide spectrum of semantic signals from the multi-modal input.We employ a multitask learning scheme to be able to use multiple datasets from the same knowledge domain to help increase the model's performance.We also use multiple objectives to regularize and fine tune different system components. في هذه الورقة، نصف عملنا نحو بناء إطار عام لكل من مهام التضمين متعدد الوسائط والتصنيف الثنائي متعدد التسميات، أثناء المشاركة في المهمة 5 (تحديد كره النساء التلقائي للوسائط المتعددة) من مسابقة SemEval 2022. نظرًا لأن التدريب المسبق للنماذج العميقة من الصفر هو مهمة جائعة للموارد والبيانات، فإن نهجنا يعتمد على ثلاث استراتيجيات رئيسية. نحن نجمع بين البنى الحديثة المختلفة لالتقاط مجموعة واسعة من الإشارات الدلالية من المدخلات متعددة الوسائط. نحن نستخدم مخططًا تعليميًا متعدد المهام حتى نتمكن من استخدام مجموعات بيانات متعددة من نفس مجال المعرفة للمساعدة في زيادة أداء النموذج. كما نستخدم أهدافًا متعددة لتنظيم مكونات النظام المختلفة وضبطها. Dans cet article, nous décrivons notre travail visant à créer un cadre générique pour les tâches d'intégration multimodale et de classification binaire multi-label, tout en participant à la tâche 5 (identification automatique de la misogynie multimédia) du concours SemEval 2022. Étant donné que la préformation de modèles profonds à partir de zéro est une tâche gourmande en ressources et en données, notre approche est basée sur trois stratégies principales. Nous combinons différentes architectures de pointe pour capturer un large spectre de signaux sémantiques à partir de l'entrée multimodale. Nous utilisons un schéma d'apprentissage multitâche pour pouvoir utiliser plusieurs ensembles de données du même domaine de connaissances pour aider à augmenter les performances du modèle. Nous utilisons également plusieurs objectifs pour régulariser et affiner différents composants du système. En este documento describimos nuestro trabajo para construir un marco genérico tanto para la incrustación multimodal como para las tareas de clasificación binaria de etiquetas múltiples, mientras participamos en la tarea 5 (Identificación automática de misoginia multimedia) de la competencia SemEval 2022. Dado que la capacitación previa de modelos profundos desde cero es una tarea que requiere muchos recursos y datos, nuestro enfoque se basa en tres estrategias principales. Combinamos diferentes arquitecturas de vanguardia para capturar un amplio espectro de señales semánticas de la entrada multimodal. Empleamos un esquema de aprendizaje multitarea para poder usar múltiples conjuntos de datos del mismo dominio de conocimiento para ayudar a aumentar el rendimiento del modelo. También utilizamos múltiples objetivos para regularizar y ajustar diferentes componentes del sistema.