# Corpus bilingüe Nasa Yuwe–Español v5 (YuweAI)
**Versión:** 5.0.0
**Fecha:** 2026-06-02
**Autores:** Juliana Chantre Astudillo; Manuel Arturo Melo Legarda
**Institución:** Institución Universitaria Colegio Mayor del Cauca — Ingeniería Informática
**Licencia:** [CC BY 4.0](LICENSE) — uso libre con **atribución obligatoria**
---
## Descripción
Conjunto de datos bilingüe **Nasa Yuwe–Español** para el Asistente Virtual Inteligente (AVI) del proyecto de grado *Desarrollo de un Asistente Virtual Inteligente para la Revitalización Digital de la Lengua Nasa Yuwe* (2026).
Incluye entradas léxicas, ejemplos, pares pregunta–respuesta y diálogos pedagógicos, con normalización UTF-8, deduplicación canónica, trazabilidad de fuentes y particiones train/dev/test.
### Estadísticas (validadas)
| Métrica | Valor |
|---------|------:|
| Total registros | 4 593 |
| Registros reales | 3 933 |
| Registros sintéticos trazables | 660 |
| Train / dev / test | 3 673 / 459 / 461 |
| Errores estructurales | **0** |
| Registros `quality_flag=ok` | **4 593** |
| Cola de revisión activa | **0** |
---
## Archivos incluidos
| Archivo | Descripción |
|---------|-------------|
| `data/corpus_bilingue_v5.csv` | Corpus completo |
| `data/corpus_v5_train.csv` | Partición entrenamiento |
| `data/corpus_v5_dev.csv` | Partición desarrollo |
| `data/corpus_v5_test.csv` | Partición prueba (393 léxicos en evaluación @1) |
| `data/talking_dictionary_pairs.csv` | Pares base Talking Dictionary |
| `schema/corpus_schema_v5.json` | Esquema JSON de validación |
| `reports/data_dictionary_v5.md` | Diccionario de campos |
| `reports/quality_report_v5.md` | Reporte de calidad |
| `reports/objective1_final_report.md` | Informe objetivo 1 |
| `reports/traceability_matrix_v5.csv` | Trazabilidad fuente–categoría |
| `reports/review_queue_v5.csv` | Cola de revisión (vacía; cierre v5) |
| `reports/normalization_report_v5.md` | Normalización y deduplicación |
| `LICENSE` | Licencia CC BY 4.0 |
| `CITATION.cff` | Metadatos de citación |
| `FUENTES_Y_ATRIBUCION.md` | Fuentes externas y uso ético |
---
## Cómo citar
Tras publicar en Zenodo, use el DOI que asigne la plataforma:
```text
Chantre Astudillo, J., & Melo Legarda, M. A. (2026). Corpus bilingüe Nasa Yuwe–Español v5 (YuweAI) [Data set]. Zenodo.
doi.org]
```
```bibtex
@dataset{chantre2026corpus,
author = {Chantre Astudillo, Juliana and Melo Legarda, Manuel Arturo},
title = {Corpus bilingüe Nasa Yuwe--Español v5 (YuweAI)},
year = {2026},
publisher = {Zenodo}
}
```
Añada el campo `doi = {...}` cuando Zenodo genere el identificador.
---
## English summary
Bilingual **Nasa Yuwe–Spanish** dataset (4,593 records) for low-resource NLP and language revitalization. Lexical entries, pedagogical dialogues, and QA pairs with full source traceability, quality metadata, and train/dev/test splits. **License: CC BY 4.0** — free use with attribution to Juliana Chantre Astudillo and Manuel Arturo Melo Legarda.
---
## Validación
```bash
python scripts/validate_corpus_v5.py
```
Resultado esperado: **4593 entradas, 0 errores**.
---
## Proyecto relacionado
- Web:
yuwe-ai.web.app
- Código:
github.com