Plataforma de corrección ortográfica para lenguas de bajo recurso, diseñada como software modular, instalable, testeable y desplegable. La arquitectura del sistema sigue un enfoque artifact-driven, donde cada corrector se empaqueta como un artefacto autocontenido y puede ser consumido de forma uniforme desde CLI, API y demostración visual.
### eib-spellchecker
**EIB Spellchecker** es una plataforma de corrección ortográfica para lenguas de bajo recurso. Está diseñada como software modular, instalable, testeable y desplegable. Su arquitectura usa un enfoque de **despliegue guiado por artefactos**, donde cada corrector se empaqueta como un artefacto autocontenido y puede ser consumido de forma uniforme desde la línea de comandos, una API web o una demostración visual.
La versión actual `0.6.0` incorpora evaluación explícita de robustez, una estrategia orientada a **vocabulario abierto** y mecanismos para reducir la **sobrecorrección** en tokens que ya son válidos.
#### Principios técnicos del sistema
* **Arquitectura con múltiples backends**: el sistema desacopla la interfaz de inferencia del mecanismo interno de corrección.
* **Despliegue guiado por artefactos**: cada backend se distribuye como un artefacto versionable, con `manifest.json` y metadatos de ejecución.
* **Robustez con vocabulario abierto**: la inferencia no depende exclusivamente de un vocabulario cerrado. Se incorporan estrategias subléxicas para mejorar el comportamiento ante palabras no vistas.
* **Abstención selectiva**: el sistema intenta evitar correcciones agresivas cuando la evidencia es débil, especialmente en nombres propios, préstamos y texto fuera de dominio.
* **Preservación de activos de investigación**: se mantienen y catalogan artefactos heredados para comparación, migración y trazabilidad experimental.
* **Desarrollo orientado a evaluación**: el proyecto incluye utilidades para medir exactitud, mejora en CER, sobrecorrección y robustez ante variantes de error.
### Capacidades principales
#### 1. Backend subword
El backend `subword` usa n-gramas de caracteres como subunidades. Está orientado a escenarios donde aparecen:
* palabras no vistas durante el entrenamiento,
* formas largas o morfológicamente complejas,
* ruido menos controlado,
* corrección con vocabulario abierto.
#### 2. Política de seguridad e …