Logo Lanfrica

Sesena0u0/Rakibolana-Malagasy

Domain:

natural language processing

Record type:

softwaredataset
Creator:
Ses
Host:
Rakibolana Malagasy # Rakibolana Web Scraper Ce dépôt contient un script Python pour extraire les mots et leurs définitions du site `rakibolana.org`. ## Fonctionnalités : - Extrait les mots et définitions du site dictionnaire malagasy `rakibolana.org`. - Gère la pagination pour chaque lettre de l'alphabet. - Exporte les données vers un fichier CSV (`rakibolana.csv`). - Convertit les données CSV en une base de données SQLite (`rakibolana.db`). - Supporte le scraping multithread pour une collecte de données plus rapide. - Permet de reprendre le processus de scraping à partir d'une lettre et d'une page spécifiques. ## Utilisation : ### Prérequis - Python 3.x - `requests` - `BeautifulSoup4` - `sqlite3` (généralement inclus avec Python) Installez les dépendances : ```bash pip install requests beautifulsoup4 ``` _Note : Si vous utilisez un environnement virtuel, assurez-vous de l'activer avant d'installer les dépendances._ ```bash .\venv\Scripts\activate pip install requests beautifulsoup4 ``` ### Lancement du Scraper Pour démarrer le processus de scraping depuis le début : ```bash python main.py ``` Pour reprendre à partir d'une lettre et d'une page spécifiques (par exemple, lettre 'D', page 5) : ```bash python main.py --letter D --page 5 ``` Le script générera `rakibolana.csv` et des fichiers temporaires dans un répertoire `temp_csvs/` pendant l'exécution, qui seront ensuite nettoyés. ### Conversion en SQLite Pour convertir le fichier `rakibolana.csv` en une base de données SQLite (`rakibolana.db`) : ```bash python csv_to_sqlite.py ``` _Assurez-vous que le fichier `rakibolana.csv` existe avant d'exécuter ce script._ ## Licence Ce projet est sous licence MIT - voir le fichier LICENSE pour plus de détails.