Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Open Language Data Initiative: Advancing Low-Resource Machine Translation for Karakalpak

Domaine:

natural language processing

Type de record:

paperdatasetmodel
Créateur:
MamSho
Hôte:avatar
This study presents several contributions for the Karakalpak language: a FLORES+ devtest dataset translated to Karakalpak, parallel corpora for Uzbek-Karakalpak, Russian-Karakalpak and English-Karakalpak of 100,000 pairs each and open-sourced fine-tuned neural models for translation across these languages. Our experiments compare different model variants and training approaches, demonstrating improvements over existing baselines. This work, conducted as part of the Open Language Data Initiative (OLDI) shared task, aims to advance machine translation capabilities for Karakalpak and contribute to expanding linguistic diversity in NLP technologies. Submitted to WMT 2024

Visit

arxiv.org

Tasks

machine translation

Tags

Computation and Language

Similaires

Data Augmentation for Low-Resource Neural Machine TranslationFrom LLM to NMT: Advancing Low-Resource Machine Translation with ClaudeNeural Machine Translation for Mooré, a Low-Resource LanguageMachine Translation into Low-resource Language VarietiesLanguage-Family Adapters for Low-Resource Multilingual Neural Machine TranslationInteractive Machine Translation with Large Language Models for Low-resource Languages

Data Augmentation for Low-Resource Neural Machine Translation

The quality of a Neural Machine Translation system depends substantially on the availability of siza

From LLM to NMT: Advancing Low-Resource Machine Translation with Claude

We show that Claude 3 Opus, a large language model (LLM) released by Anthropic in March 2024, exhibi

Neural Machine Translation for Mooré, a Low-Resource Language

Machine Translation into Low-resource Language Varieties

State-of-the-art machine translation (MT) systems are typically trained to generate the "standard" t

Language-Family Adapters for Low-Resource Multilingual Neural Machine Translation

Large multilingual models trained with self-supervision achieve state-of-the-art results in a wide r

Interactive Machine Translation with Large Language Models for Low-resource Languages

Large language models (LLM) have been applied to machine translation with notable success. However,