Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Semi-supervised Neural Machine Translation with Consistency Regularization for Low-Resource Languages

Domain:

natural language processing

Record type:

papermodel
Creator:
PhaPhaNguNgu
Host:avatar
The advent of deep learning has led to a significant gain in machine translation. However, most of the studies required a large parallel dataset which is scarce and expensive to construct and even unavailable for some languages. This paper presents a simple yet effective method to tackle this problem for low-resource languages by augmenting high-quality sentence pairs and training NMT models in a semi-supervised manner. Specifically, our approach combines the cross-entropy loss for supervised learning with KL Divergence for unsupervised fashion given pseudo and augmented target sentences derived from the model. We also introduce a SentenceBERT-based filter to enhance the quality of augmenting data by retaining semantically similar sentence pairs. Experimental results show that our approach significantly improves NMT baselines, especially on low-resource datasets with 0.46--2.03 BLEU scores. We also demonstrate that using unsupervised training for augmented data is more efficient than reusing the ground-truth target sentences for supervised learning. TMP and GN contributed equally

Visit

arxiv.org

Tasks

machine translation

Tags

Computation and LanguageMachine Learning

Similar

Integrating Unsupervised Data Generation into Self-Supervised Neural Machine Translation for Low-Resource LanguagesMultilingual Neural Machine Translation for Low Resource LanguagesSemi-Supervised Marginal Likelihood Training with Curriculum-Guided Rewriting for Low-Resource Machine TranslationLow-Resource Neural Machine Translation for Southern African LanguagesNeural Machine Translation for Low-Resource Languages: A SurveyLow Resource Neural Machine Translation: A Benchmark for Five African Languages

Integrating Unsupervised Data Generation into Self-Supervised Neural Machine Translation for Low-Resource Languages

For most language combinations, parallel data is either scarce or simply unavailable. To address thi

Multilingual Neural Machine Translation for Low Resource Languages

Neural Machine Translation (NMT) has been shown to be more effective in translation tasks compared t

Semi-Supervised Marginal Likelihood Training with Curriculum-Guided Rewriting for Low-Resource Machine Translation

Large language models continue to face challenges in translating low-resource languages with scarce

Low-Resource Neural Machine Translation for Southern African Languages

Low-resource African languages have not fully benefited from the progress in neural machine translat

Neural Machine Translation for Low-Resource Languages: A Survey

Neural Machine Translation (NMT) has seen a tremendous spurt of growth in less than ten years, and h

Low Resource Neural Machine Translation: A Benchmark for Five African Languages

Recent advents in Neural Machine Translation (NMT) have shown improvements in low-resource language (LRL) translation tasks. In this work, we benchmark NMT between English and five African LRL pairs (Swahili, Amharic, Tigrigna, Oromo, Somali [SATOS]). We collected