Logo Lanfrica
  • Accueil
  • Atlas
  • Analyses
  • Documentation
  • Sign in

© 2026 Lanfrica. Tous droits réservés. Tous les droits d'auteur des ressources affichées sur le site Web Lanfrica appartiennent aux détenteurs de droits d'auteur d'origine, sauf indication contraire explicite.

Fine-Tuning Methods and Dataset Structures for Multilingual Neural Machine Translation: A Kazakh–English–Russian Case Study in the IT Domain

Domaine:

natural language processing

Type de record:

dataset
Créateur:
ZhaZha
Éditeur:
MDP
Hôte:
This study explores fine-tuning methods and dataset structures for multilingual neural machine translation using the No Language Left Behind model, with a case study on Kazakh, English, and Russian. We compare single-stage and two-stage fine-tuning approaches, as well as triplet versus non-triplet dataset configurations, to improve translation quality. A high-quality, 50,000-triplet dataset in information technology domain, manually translated and expert-validated, serves as the in-domain benchmark, complemented by out-of-domain corpora like KazParC. Evaluations using BLEU, chrF, METEOR, and TER metrics reveal that single-stage fine-tuning excels for low-resource pairs (e.g., 0.48 BLEU, 0.77 chrF for Kazakh → Russian), while two-stage fine-tuning benefits high-resource pairs (Russian → English). Triplet datasets improve cross-linguistic consistency compared with non-triplet structures. Our reproducible framework offers practical guidance for adapting neural machine translation to technical domains and low-resource languages.

Visit

doi.org

Tasks

machine translation

Licenses

https://creativecommons.org/licenses/by/4.0/

Similaires

Exploring Intrinsic Language-specific Subspaces in Fine-tuning Multilingual Neural Machine TranslationImproving Kimbundu–Portuguese Neural Machine Translation through Fine-Tuning of Multilingual ModelsThe Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation تأثير المجال والتشكيل في الترجمة الآلية العصبية اليوروبية- الإنجليزية The Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation The Effect of Domain and Diacritics in Yorùbá-English Neural Machine TranslationLow Resourced Multilingual Neural Machine Translation for Ometo-EnglishParameter-Efficient Fine-Tuning for LLM-Based Arabic-to-English Machine TranslationThe Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation

Exploring Intrinsic Language-specific Subspaces in Fine-tuning Multilingual Neural Machine Translation

Multilingual neural machine translation models support fine-tuning hundreds of languages simultaneou

Improving Kimbundu–Portuguese Neural Machine Translation through Fine-Tuning of Multilingual Models

Neural Machine Translation (NMT) systems have achieved strong performance for highresource

The Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation تأثير المجال والتشكيل في الترجمة الآلية العصبية اليوروبية- الإنجليزية The Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation The Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation

Massively multilingual machine translation (MT) has shown impressive capabilities, including zero an

Low Resourced Multilingual Neural Machine Translation for Ometo-English

In this paper, we present a new approach to overcome the problem of language resources that share si

Parameter-Efficient Fine-Tuning for LLM-Based Arabic-to-English Machine Translation

Large Language Models (LLMs) such as GPT-3, BLOOM, BERT... have revolutionized natural language proc

The Effect of Domain and Diacritics in Yorùbá-English Neural Machine Translation

Massively multilingual machine translation (MT) has shown impressive capabilities, including zero and few-shot translation between low-resource language pairs. However, these models are often evaluated on high-resource languages with the assumption that they genera