Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Corpus bilingüe Nasa Yuwe–Español v5 (YuweAI)

Domaine:

natural language processing

Type de record:

dataset
Créateur:
ChaMel
Éditeur:
Zenodo
Hôte:avatar
# Corpus bilingüe Nasa Yuwe–Español v5 (YuweAI) **Versión:** 5.0.0 **Fecha:** 2026-06-02 **Autores:** Juliana Chantre Astudillo; Manuel Arturo Melo Legarda **Institución:** Institución Universitaria Colegio Mayor del Cauca — Ingeniería Informática **Licencia:** [CC BY 4.0](LICENSE) — uso libre con **atribución obligatoria** --- ## Descripción Conjunto de datos bilingüe **Nasa Yuwe–Español** para el Asistente Virtual Inteligente (AVI) del proyecto de grado *Desarrollo de un Asistente Virtual Inteligente para la Revitalización Digital de la Lengua Nasa Yuwe* (2026). Incluye entradas léxicas, ejemplos, pares pregunta–respuesta y diálogos pedagógicos, con normalización UTF-8, deduplicación canónica, trazabilidad de fuentes y particiones train/dev/test. ### Estadísticas (validadas) | Métrica | Valor | |---------|------:| | Total registros | 4 593 | | Registros reales | 3 933 | | Registros sintéticos trazables | 660 | | Train / dev / test | 3 673 / 459 / 461 | | Errores estructurales | **0** | | Registros `quality_flag=ok` | **4 593** | | Cola de revisión activa | **0** | --- ## Archivos incluidos | Archivo | Descripción | |---------|-------------| | `data/corpus_bilingue_v5.csv` | Corpus completo | | `data/corpus_v5_train.csv` | Partición entrenamiento | | `data/corpus_v5_dev.csv` | Partición desarrollo | | `data/corpus_v5_test.csv` | Partición prueba (393 léxicos en evaluación @1) | | `data/talking_dictionary_pairs.csv` | Pares base Talking Dictionary | | `schema/corpus_schema_v5.json` | Esquema JSON de validación | | `reports/data_dictionary_v5.md` | Diccionario de campos | | `reports/quality_report_v5.md` | Reporte de calidad | | `reports/objective1_final_report.md` | Informe objetivo 1 | | `reports/traceability_matrix_v5.csv` | Trazabilidad fuente–categoría | | `reports/review_queue_v5.csv` | Cola de revisión (vacía; cierre v5) | | `reports/normalization_report_v5.md` | Normalización y deduplicación | | `LICENSE` | Licencia CC BY 4.0 | | `CITATION.cff` | Metadatos de citación | | `FUENTES_Y_ATRIBUCION.md` | Fuentes externas y uso ético | --- ## Cómo citar Tras publicar en Zenodo, use el DOI que asigne la plataforma: ```text Chantre Astudillo, J., & Melo Legarda, M. A. (2026). Corpus bilingüe Nasa Yuwe–Español v5 (YuweAI) [Data set]. Zenodo. doi.org] ``` ```bibtex @dataset{chantre2026corpus, author = {Chantre Astudillo, Juliana and Melo Legarda, Manuel Arturo}, title = {Corpus bilingüe Nasa Yuwe--Español v5 (YuweAI)}, year = {2026}, publisher = {Zenodo} } ``` Añada el campo `doi = {...}` cuando Zenodo genere el identificador. --- ## English summary Bilingual **Nasa Yuwe–Spanish** dataset (4,593 records) for low-resource NLP and language revitalization. Lexical entries, pedagogical dialogues, and QA pairs with full source traceability, quality metadata, and train/dev/test splits. **License: CC BY 4.0** — free use with attribution to Juliana Chantre Astudillo and Manuel Arturo Melo Legarda. --- ## Validación ```bash python scripts/validate_corpus_v5.py ``` Resultado esperado: **4593 entradas, 0 errores**. --- ## Proyecto relacionado - Web: yuwe-ai.web.app - Código: github.com

Visit

doi.orgzenodo.org

Languages

Melo

Tags

Nasa YuwePaezlengua indígenacorpus bilingüeprocesamiento de lenguaje naturalbajos recursosrevitalización lingüísticaNLPlow-resource languages

Licenses

Creative Commons Attribution 4.0 Internationalhttps://creativecommons.org/licenses/by/4.0/legalcode

Similaires

Contexto de elaboración del diccionario bilingüe bubi-españolPRONUNCIATION LEARNING SYSTEM FOR THE 32 VOWEL SYSTEM OF NASA YUWE LANGUAGETransformación de la práctica de enseñanza simultánea del Nasa Yuwe y castellano mediante el enfoque del translingüismo y escritura para aprender lengua en el grado tercero de la básica primariaLynLing/NASA-africaNasa-writes/Capstone_Project_Nana_Aisha_AhmedNASA AfriSAR Project

Contexto de elaboración del diccionario bilingüe bubi-español

El artículo resalta la importancia del diccionario en el proceso de revitalización del bubi, una len

PRONUNCIATION LEARNING SYSTEM FOR THE 32 VOWEL SYSTEM OF NASA YUWE LANGUAGE

International audience no abstract

Transformación de la práctica de enseñanza simultánea del Nasa Yuwe y castellano mediante el enfoque del translingüismo y escritura para aprender lengua en el grado tercero de la básica primaria

El presente informe de investigación describe el proceso que llevó a cabo la profesora investigadora

LynLing/NASA-africa

# NASA-africa This is a part of EC601 project in which we have planned to build a website which wou

Nasa-writes/Capstone_Project_Nana_Aisha_Ahmed

Capstone project analyzing the 2018 NDHS dataset in Google Sheets to find the socioeconomic drivers

NASA AfriSAR Project

This data set contains geotagged images collected over Gabon, Africa. The images were taken by the N