Logo Lanfrica

kapumota/eib-spellchecker

Domain:

natural language processing

Record type:

software
Creator:
kap
Host:
Plataforma de corrección ortográfica para lenguas de bajo recurso, diseñada como software modular, instalable, testeable y desplegable. La arquitectura del sistema sigue un enfoque artifact-driven, donde cada corrector se empaqueta como un artefacto autocontenido y puede ser consumido de forma uniforme desde CLI, API y demostración visual. ### eib-spellchecker **EIB Spellchecker** es una plataforma de corrección ortográfica para lenguas de bajo recurso. Está diseñada como software modular, instalable, testeable y desplegable. Su arquitectura usa un enfoque de **despliegue guiado por artefactos**, donde cada corrector se empaqueta como un artefacto autocontenido y puede ser consumido de forma uniforme desde la línea de comandos, una API web o una demostración visual. La versión actual `0.6.0` incorpora evaluación explícita de robustez, una estrategia orientada a **vocabulario abierto** y mecanismos para reducir la **sobrecorrección** en tokens que ya son válidos. #### Principios técnicos del sistema * **Arquitectura con múltiples backends**: el sistema desacopla la interfaz de inferencia del mecanismo interno de corrección. * **Despliegue guiado por artefactos**: cada backend se distribuye como un artefacto versionable, con `manifest.json` y metadatos de ejecución. * **Robustez con vocabulario abierto**: la inferencia no depende exclusivamente de un vocabulario cerrado. Se incorporan estrategias subléxicas para mejorar el comportamiento ante palabras no vistas. * **Abstención selectiva**: el sistema intenta evitar correcciones agresivas cuando la evidencia es débil, especialmente en nombres propios, préstamos y texto fuera de dominio. * **Preservación de activos de investigación**: se mantienen y catalogan artefactos heredados para comparación, migración y trazabilidad experimental. * **Desarrollo orientado a evaluación**: el proyecto incluye utilidades para medir exactitud, mejora en CER, sobrecorrección y robustez ante variantes de error. ### Capacidades principales #### 1. Backend subword El backend `subword` usa n-gramas de caracteres como subunidades. Está orientado a escenarios donde aparecen: * palabras no vistas durante el entrenamiento, * formas largas o morfológicamente complejas, * ruido menos controlado, * corrección con vocabulario abierto. #### 2. Política de seguridad e …

Languages

Licenses