Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

LittleDarkBug/Gender_SOSSOU_Didi_Orlog_Project

Domaine:

natural language processing

Type de record:

software
Créateur:
Lit
Hôte:
Ce projet vise à développer un système de classification automatique pour déterminer le genre (masculin/féminin) à partir des prénoms et noms de famille présents sur les cartes d'identité nationales du Togo. Cette solution s'appuie sur des techniques d'apprentissage automatique et d'ingénierie des caractéristiques linguistiques. # Détection Automatique de Genre pour la Carte d'Identité Nationale du Togo ## Description du Projet Ce projet vise à développer un système de classification automatique pour déterminer le genre (masculin/féminin) à partir des prénoms et noms de famille présents sur les cartes d'identité nationales du Togo. Cette solution s'appuie sur des techniques d'apprentissage automatique et d'ingénierie des caractéristiques linguistiques. ### Contexte et Objectifs - **But** : Automatiser la détection du genre basée sur l'analyse des noms togolais - **Contexte** : Améliorer les processus de traitement des documents d'identité - **Approche** : Utilisation de modèles d'apprentissage automatique (RandomForest et CatBoost) ## Méthodologie ### Étapes Principales 1. **Chargement et exploration des données** - Import du dataset principal (`dataset_names.csv`) contenant prénoms, noms et genres - Analyse exploratoire des données d'entraînement - Chargement du dataset de test externe (`test_dataset.csv`) 2. **Ingénierie des caractéristiques (Feature Engineering)** - Extraction de caractéristiques linguistiques des prénoms : - Analyse des terminaisons genrées (suffixes féminins/masculins) - Comptage des voyelles et consonnes - Longueur des prénoms - Ratios et proportions linguistiques - Création de variables dérivées pour améliorer la performance des modèles 3. **Séparation des ensembles de données** - Division train/test (80%/20%) avec stratification - Préparation des features (X) et des labels (y) - Encodage : 1 = Masculin, 0 = Féminin 4. **Entraînement des modèles** - **RandomForest Classifier** : Ensemble de arbres de décision - **CatBoost Classifier** : Algorithme de gradient boosting optimisé 5. **Évaluation des performances** - Métriques calculées : Accuracy, Precision, Recall, F1-Score - Matrice de confusion pour analyse détaillée - Test sur dataset externe pour validation 6. **Prédiction** - Fonction `predict_gender()` pour prédictions en temps réel - Interface simple …

Visit

github.com

Tasks

text classification

Similaires

LittleDarkBug/2024_togo_fiber_optics_prediction_challenge_submission_zindi

LittleDarkBug/2024_togo_fiber_optics_prediction_challenge_submission_zindi

Final submission for the togo fiber optics adoption prediction challenge on Zindi. 6th place solutio