Logo Lanfrica

CeciGonSer/linguistic-cot-low-resource-mt

Domain:

natural language processing

Record type:

project
Creator:
Cec
Host:
Este proyecto explora el uso de Chain-of-Thought (CoT) junto con conocimiento lingüístico para mejorar la calidad de la traducción automática en lenguas de bajos recursos, específicamente en el par purépecha–español. # Proyecto Traducción Purépecha-Español Sistema de traducción automática Purépecha-Español usando LLMs con Chain-of-Thought y destilación de conocimiento. ## 📁 Estructura ``` Proyecto_Traduccion_Purepecha/ ├── notebooks/ │ ├── Entrenar_maestro_evaluacion_completa.ipynb # Entrenamiento 5-fold CV │ ├── Entrenar maestro (1).ipynb # Versión anterior │ ├── desarrollo_dataset_purepecha_solo_gemini.ipynb # Generación glosas ├── datasets/ │ ├── chamo_multi_RD_enriquecido.pkl # Dataset principal (800) │ └── biblia_dataset_RD*.pickle # Datasets Biblia ├── modelos/ │ ├── mejor_modelo_5fold_cot_completo_*/ # CoT completo │ ├── mejor_modelo_5fold_cot_glosa_*/ # Solo glosa │ └── mejor_modelo_5fold_no_cot_*/ # Sin CoT └── resultados/ ├── resultados_5fold.csv # Por fold └── estadisticas_5fold.csv # Agregadas ``` ## 🎯 Notebooks Principales 1. **Entrenar_maestro_evaluacion_completa.ipynb** - Entrenamiento con 5-fold cross-validation - 3 semillas (42, 123, 456) - Métricas: BLEU, chrF, METEOR, BERTScore 2. **desarrollo_dataset_purepecha_solo_gemini.ipynb** - Generación de glosas con Gemini 2.5 Flash - RAG con gramática purépecha - Enriquecimiento morfológico ## 📊 Datasets - **chamo_multi_RD_enriquecido.pkl**: 800 ejemplos (640 train, 160 test) - **biblia_dataset_RD*.pickle**: Corpus bíblico - **faiss_index_gramatica/**: Base vectorial para RAG ## 🏆 Mejores Resultados (5-fold) - BLEU: ~70-73 - chrF: ~84-86 - METEOR: ~80-84 - BERTScore: ~92-94 ## 🔧 Configuración - Modelo base: Llama 3.1 8B Instruct - LoRA: r=16, alpha=32 - Optimizador: Adafactor - Max length: 1054 tokens

Languages