# Bororo-Corpus (CorBo) (Pré-lançamento v0.5)
Este corpus contém dados da **língua Boe-Bororo**, anotados segundo o padrão
Universal Dependencies.
Integra traduções alinhadas, glossas lexicais e metadados provenientes
de diversas fontes do projeto **Boe eno moto**.
---
## 📦 Conteúdo do pacote
| Arquivo | Descrição |
|----------|------------|
| **Bororo_UD_enriched_v5.conllu** | Corpus principal com anotações UD, traduções (PT/EN), enriquecimento lexical e metadados por sentença. |
| **Bororo_UD_enriched_v5_meta_report.txt** | Relatório com estatísticas de alinhamento e metadados. |
| **bororo_lexical_summary.tsv** | Sumário lexical com frequência dos lemas, glossas, classificadores (CLS) e proclíticos. |
| **bororo_lexical_missing_fields.tsv** | Lista dos lemas que ainda não possuem glossas, CLS ou proclíticos preenchidos. |
| **bororo_corpus_parallel.csv** | Corpus paralelo (Bororo ↔ Português) usado para o alinhamento das traduções. |
| **bororo_lexicon_template_for_enrichment.csv** | Léxico utilizado para enriquecer os campos MISC (GLOSS, CLS, PRCLITIC). |
| **README.md** | Este documento. |
---
## 🧩 Estrutura do arquivo CoNLL-U
Cada linha de token segue o formato padrão UD (10 colunas):
**Comentários por sentença:**
text =
translation_pt =
translation_en =
meta: sourcefile=; genre= ;
elicitation=no; align_tier=
**Campos do MISC:**
| Campo | Descrição |
|--------|------------|
| `LEMMA_SRC` | Origem do lema (`conllu` ou dicionário) |
| `POS_FINE` | Classe gramatical detalhada (derivada de XPOS ou UPOS) |
| `ORTHO` | Forma ortográfica |
| `GLOSS` | Glossa lexical (manual ou do dicionário) |
| `CLS` | Classe de posse / classificador (`o`, `ke`, `aku`, `imo`, `kuie`, `kudawu` etc.) |
| `PRCLITIC` | Proclítico (ex.: `i=`, `a=`, `bo=`, `ka=`) |
| `GLOSS_SEG` | Glossa segmentada (a ser adicionada nas próximas versões) |
| `AUDIO` | Caminho para o áudio do token (previsto para a versão futura) |
---
## 🌍 Fontes de dados
| Fonte | Tipo | Observações |
| …