Este proyecto explora el uso de Chain-of-Thought (CoT) junto con conocimiento lingüístico para mejorar la calidad de la traducción automática en lenguas de bajos recursos, específicamente en el par purépecha–español.
# Proyecto Traducción Purépecha-Español
Sistema de traducción automática Purépecha-Español usando LLMs con Chain-of-Thought y destilación de conocimiento.
## 📁 Estructura
```
Proyecto_Traduccion_Purepecha/
├── notebooks/
│ ├── Entrenar_maestro_evaluacion_completa.ipynb # Entrenamiento 5-fold CV
│ ├── Entrenar maestro (1).ipynb # Versión anterior
│ ├── desarrollo_dataset_purepecha_solo_gemini.ipynb # Generación glosas
├── datasets/
│ ├── chamo_multi_RD_enriquecido.pkl # Dataset principal (800)
│ └── biblia_dataset_RD*.pickle # Datasets Biblia
├── modelos/
│ ├── mejor_modelo_5fold_cot_completo_*/ # CoT completo
│ ├── mejor_modelo_5fold_cot_glosa_*/ # Solo glosa
│ └── mejor_modelo_5fold_no_cot_*/ # Sin CoT
└── resultados/
├── resultados_5fold.csv # Por fold
└── estadisticas_5fold.csv # Agregadas
```
## 🎯 Notebooks Principales
1. **Entrenar_maestro_evaluacion_completa.ipynb**
- Entrenamiento con 5-fold cross-validation
- 3 semillas (42, 123, 456)
- Métricas: BLEU, chrF, METEOR, BERTScore
2. **desarrollo_dataset_purepecha_solo_gemini.ipynb**
- Generación de glosas con Gemini 2.5 Flash
- RAG con gramática purépecha
- Enriquecimiento morfológico
## 📊 Datasets
- **chamo_multi_RD_enriquecido.pkl**: 800 ejemplos (640 train, 160 test)
- **biblia_dataset_RD*.pickle**: Corpus bíblico
- **faiss_index_gramatica/**: Base vectorial para RAG
## 🏆 Mejores Resultados (5-fold)
- BLEU: ~70-73
- chrF: ~84-86
- METEOR: ~80-84
- BERTScore: ~92-94
## 🔧 Configuración
- Modelo base: Llama 3.1 8B Instruct
- LoRA: r=16, alpha=32
- Optimizador: Adafactor
- Max length: 1054 tokens