Rakibolana Malagasy
# Rakibolana Web Scraper
Ce dépôt contient un script Python pour extraire les mots et leurs définitions du site `rakibolana.org`.
## Fonctionnalités :
- Extrait les mots et définitions du site dictionnaire malagasy `rakibolana.org`.
- Gère la pagination pour chaque lettre de l'alphabet.
- Exporte les données vers un fichier CSV (`rakibolana.csv`).
- Convertit les données CSV en une base de données SQLite (`rakibolana.db`).
- Supporte le scraping multithread pour une collecte de données plus rapide.
- Permet de reprendre le processus de scraping à partir d'une lettre et d'une page spécifiques.
## Utilisation :
### Prérequis
- Python 3.x
- `requests`
- `BeautifulSoup4`
- `sqlite3` (généralement inclus avec Python)
Installez les dépendances :
```bash
pip install requests beautifulsoup4
```
_Note : Si vous utilisez un environnement virtuel, assurez-vous de l'activer avant d'installer les dépendances._
```bash
.\venv\Scripts\activate
pip install requests beautifulsoup4
```
### Lancement du Scraper
Pour démarrer le processus de scraping depuis le début :
```bash
python main.py
```
Pour reprendre à partir d'une lettre et d'une page spécifiques (par exemple, lettre 'D', page 5) :
```bash
python main.py --letter D --page 5
```
Le script générera `rakibolana.csv` et des fichiers temporaires dans un répertoire `temp_csvs/` pendant l'exécution, qui seront ensuite nettoyés.
### Conversion en SQLite
Pour convertir le fichier `rakibolana.csv` en une base de données SQLite (`rakibolana.db`) :
```bash
python csv_to_sqlite.py
```
_Assurez-vous que le fichier `rakibolana.csv` existe avant d'exécuter ce script._
## Licence
Ce projet est sous licence MIT - voir le fichier LICENSE pour plus de détails.