Abstract Rapid advances in deep learning models have made it easier for public and crackers to generate hyper-realistic deepfake videos in which faces are swapped. Such deepfake videos may constitute a significant threat to the world if they are misused to blackmail public figures and to deceive systems of face recognition. As a result, distinguishing these fake videos from real ones has become fundamental. This paper introduces a new deepfake video detection method. You Only Look Once (YOLO) face detector is used to detect faces from video frames. A proposed hybrid method based on proposing two different feature extraction methods is applied to these faces. The first feature extraction method, a proposed Convolution Neural Network (CNN), is based on the Histogram of Oriented Gradient (HOG) method. The second one is an ameliorated XceptionNet CNN. The two extracted sets of features are merged together and fed as input to a sequence of Gated Recurrent Units (GRUs) to extract the spatial and temporal features and then individuate the authenticity of videos. The proposed method is trained on the CelebDF-FaceForencics++ (c23) dataset and evaluated on the CelebDF test set. The experimental results and analysis confirm the superiority of the suggested method over the state-of-the-art methods. جعلت التطورات السريعة في نماذج التعلم العميق من السهل على الجمهور والمفرقعات إنشاء مقاطع فيديو عميقة التزييف فائقة الواقعية يتم فيها تبديل الوجوه. قد تشكل مقاطع الفيديو المزيفة هذه تهديدًا كبيرًا للعالم إذا تم إساءة استخدامها لابتزاز الشخصيات العامة وخداع أنظمة التعرف على الوجوه. ونتيجة لذلك، أصبح التمييز بين مقاطع الفيديو المزيفة هذه ومقاطع الفيديو الحقيقية أمرًا أساسيًا. تقدم هذه الورقة طريقة جديدة للكشف عن الفيديو العميق. يتم استخدام كاشف الوجه (YOLO) مرة واحدة فقط للكشف عن الوجوه من إطارات الفيديو. يتم تطبيق طريقة هجينة مقترحة تعتمد على اقتراح طريقتين مختلفتين لاستخراج الميزات على هذه الوجوه. تعتمد طريقة استخراج الميزة الأولى، وهي شبكة عصبية التفافية مقترحة (CNN)، على الرسم البياني لطريقة التدرج الموجه (HOG). والثاني هو تحسين XceptionNet CNN. يتم دمج مجموعتي الميزات المستخرجة معًا وتغذيتها كمدخلات لسلسلة من الوحدات المتكررة المسورة (GRUs) لاستخراج الميزات المكانية والزمانية ثم تمييز أصالة مقاطع الفيديو. يتم تدريب الطريقة المقترحة على مجموعة بيانات CelebDF - FaceForencics ++ (c23) ويتم تقييمها على مجموعة اختبار CelebDF. تؤكد النتائج التجريبية والتحليل تفوق الطريقة المقترحة على أحدث الأساليب. Résumé Les progrès rapides des modèles d'apprentissage profond ont permis au public et aux crackers de générer plus facilement des vidéos hyperréalistes de deepfake dans lesquelles les visages sont échangés. De telles vidéos deepfake peuvent constituer une menace importante pour le monde si elles sont utilisées à mauvais escient pour faire chanter des personnalités publiques et tromper les systèmes de reconnaissance faciale. Par conséquent, distinguer ces fausses vidéos des vraies est devenu fondamental. Cet article présente une nouvelle méthode de détection vidéo deepfake. Le détecteur de visage You Only Look Once (Yolo) est utilisé pour détecter les visages à partir d'images vidéo. Une méthode hybride proposée basée sur la proposition de deux méthodes d'extraction de caractéristiques différentes est appliquée à ces faces. La première méthode d'extraction de caractéristiques, un réseau neuronal à convolution (CNN) proposé, est basée sur la méthode de l'histogramme du gradient orienté (HOG). Le second est un CNN XceptionNet amélioré. Les deux ensembles de caractéristiques extraits sont fusionnés et alimentés en entrée d'une séquence d'unités récurrentes déclenchées (GRU) pour extraire les caractéristiques spatiales et temporelles, puis individualiser l'authenticité des vidéos. La méthode proposée est formée sur l'ensemble de données CelebDF-FaceForencics ++ (c23) et évaluée sur l'ensemble de tests CelebDF. Les résultats expérimentaux et l'analyse confirment la supériorité de la méthode proposée sur les méthodes de pointe. Resumen Los rápidos avances en los modelos de aprendizaje profundo han facilitado que el público y los crackers generen videos deepfake hiperrealistas en los que se intercambian caras. Tales videos deepfake pueden constituir una amenaza significativa para el mundo si se utilizan indebidamente para chantajear a figuras públicas y engañar a los sistemas de reconocimiento facial. Como resultado, distinguir estos vídeos falsos de los reales se ha convertido en algo fundamental. Este documento presenta un nuevo método de detección de vídeo deepfake. El detector de rostros You Only Look Once (Yolo) se utiliza para detectar rostros de fotogramas de vídeo. Se aplica a estas caras un método híbrido propuesto basado en proponer dos métodos de extracción de características diferentes. El primer método de extracción de características, una red neuronal de convolución (CNN) propuesta, se basa en el método del histograma de gradiente orientado (HOG). La segunda es una XceptionNet CNN mejorada. Los dos conjuntos extraídos de características se fusionan y se alimentan como entrada a una secuencia de Unidades Recurrentes Cerradas (Gru) para extraer las características espaciales y temporales y luego individualizar la autenticidad de los videos. El método propuesto se entrena en el conjunto de datos CelebDF-FaceForencics++ (c23) y se evalúa en el conjunto de pruebas CelebDF. Los resultados experimentales y el análisis confirman la superioridad del método sugerido sobre los métodos del estado de la técnica.