Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages

Domaine:

natural language processing

Type de record:

paper
Créateur:
KumYamAle
Hôte:avatar
Subword tokenization hinders low-resource language processing by imposing frequency patterns from dominant languages onto script-sharing variants. Byte-level models bypass this issue by processing raw UTF-8 characters, yet they create a granularity mismatch for word-level tasks in non-Latin scripts. Hierarchical byte-level architectures address this mismatch by grouping bytes into word-aligned chunks. However, these architectures require massive training data and suffer from representational misalignment when paired with frozen subword-based language models. In this paper, we propose an adapted hierarchical network framework that bridges this modality gap without extensive training. Our method initializes byte embeddings directly from the subword representations of a frozen base model. We apply a chunk alignment loss to project dynamically grouped byte chunks toward precomputed subword targets, and interleave lightweight part-of-speech (POS) supervision to guide boundary detection. Experiments across six languages demonstrate that our tokenizer-free approach improves performance for word-level morphological tasks, yielding up to a 13.3% improvement on POS tagging. Accepted to EMNLP 2026

Visit

arxiv.org

Tasks

part of speech tagging

Tags

Computation and Language

Similaires

Scaling Model Size and Zero-Shot Transfer to Low-Resource Languages in XTREMERobustness of Intermediate-Task Training in Zero-Shot Transfer to Low-Resource LanguagesSyntactic vs. Semantic Task Training for Zero-Shot Transfer in Low-Resource LanguagesOptimal Transport Distillation for Cross-Lingual Zero-Shot Transfer in Low-Resource LanguagesContrastive Multimodal Pre-training for Zero-Shot Cross-Lingual Transfer in Low-Resource LanguagesMultilingual Adversarial Training for Robust Zero-Shot Cross-Lingual Transfer in Low-Resource Languages

Scaling Model Size and Zero-Shot Transfer to Low-Resource Languages in XTREME

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuni

Robustness of Intermediate-Task Training in Zero-Shot Transfer to Low-Resource Languages

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuni

Syntactic vs. Semantic Task Training for Zero-Shot Transfer in Low-Resource Languages

Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuni

Optimal Transport Distillation for Cross-Lingual Zero-Shot Transfer in Low-Resource Languages

Benefiting from transformer-based pre-trained language models, neural ranking models have made signi

Contrastive Multimodal Pre-training for Zero-Shot Cross-Lingual Transfer in Low-Resource Languages

This paper studies zero-shot cross-lingual transfer of vision-language models. Specifically, we focu

Multilingual Adversarial Training for Robust Zero-Shot Cross-Lingual Transfer in Low-Resource Languages

Pre-trained multilingual language encoders, such as multilingual BERT and XLM-R, show great potentia