Logo Lanfrica

Multilingual Neural Machine Translation with Language Clustering الترجمة الآلية العصبية متعددة اللغات مع تجميع اللغات Traduction automatique neuronale multilingue avec regroupement linguistique Traducción automática neuronal multilingüe con agrupación de idiomas

Domaine:

natural language processing

Type de record:

paper
Créateur:
Xu JiaDi Yin
Éditeur:
Ope
Hôte:avatar
Multilingual neural machine translation (NMT), which translates multiple languages using a single model, is of great practical importance due to its advantages in simplifying the training process, reducing online maintenance costs, and enhancing low-resource and zero-shot translation.Given there are thousands of languages in the world and some of them are very different, it is extremely burdensome to handle them all in a single model or use a separate model for each language pair.Therefore, given a fixed resource budget, e.g., the number of models, how to determine which languages should be supported by one model is critical to multilingual NMT, which, unfortunately, has been ignored by previous work.In this work, we develop a framework that clusters languages into different groups and trains one multilingual model for each cluster.We study two methods for language clustering: (1) using prior knowledge, where we cluster languages according to language family, and (2) using language embedding, in which we represent each language by an embedding vector and cluster them in the embedding space.In particular, we obtain the embedding vectors of all the languages by training a universal neural machine translation model.Our experiments on 23 languages show that the first clustering method is simple and easy to understand but leading to suboptimal translation accuracy, while the second method sufficiently captures the relationship among languages well and improves the translation accuracy for almost all the languages over baseline methods. تعتبر الترجمة الآلية العصبية متعددة اللغات (NMT)، التي تترجم لغات متعددة باستخدام نموذج واحد، ذات أهمية عملية كبيرة نظرًا لمزاياها في تبسيط عملية التدريب، وتقليل تكاليف الصيانة عبر الإنترنت، وتعزيز الترجمة منخفضة الموارد والخالية من اللقطات. نظرًا لوجود آلاف اللغات في العالم وبعضها مختلف تمامًا، فمن الصعب للغاية التعامل معها جميعًا في نموذج واحد أو استخدام نموذج منفصل لكل زوج لغوي. لذلك، نظرًا لميزانية الموارد الثابتة، على سبيل المثال، عدد النماذج، كيفية تحديد اللغات التي يجب أن يدعمها نموذج واحد أمر بالغ الأهمية لـ NMT متعدد اللغات، والذي، للأسف، تم تجاهله في العمل السابق. في هذا العمل، نقوم بتطوير إطار يجمع اللغات في مجموعات مختلفة ويدرب نموذجًا واحدًا متعدد اللغات لكل مجموعة. ندرس طريقتين لتجميع اللغة: (1) باستخدام المعرفة السابقة، حيث نقوم بتجميع اللغات وفقًا لعائلة اللغة، و (2) باستخدام تضمين اللغة، حيث نمثل كل لغة بواسطة متجه تضمين ونجمعها في مساحة التضمين. على وجه الخصوص، نحصل على تضمين متجهات جميع اللغات من خلال تدريب نموذج عالمي للترجمة الآلية العصبية. تُظهر تجاربنا على 23 لغة أن طريقة التجميع الأولى بسيطة وسهلة الفهم ولكنها تؤدي إلى دقة ترجمة دون المستوى الأمثل، في حين أن الطريقة الثانية تلتقط العلاقة بين اللغات بشكل جيد وتحسن دقة الترجمة لجميع اللغات تقريبًا على الطرق الأساسية. La traduction automatique neuronale multilingue (NMT), qui traduit plusieurs langues à l'aide d'un seul modèle, est d'une grande importance pratique en raison de ses avantages en matière de simplification du processus de formation, de réduction des coûts de maintenance en ligne et d'amélioration de la traduction à faible ressource et à prise de vue nulle. Étant donné qu'il existe des milliers de langues dans le monde et que certaines d'entre elles sont très différentes, il est extrêmement fastidieux de les gérer toutes dans un seul modèle ou d'utiliser un modèle distinct pour chaque paire de langues. Par conséquent, compte tenu d'un budget de ressources fixe, par exemple, le nombre de modèles, comment déterminer quelles langues doivent être prises en charge par un modèle est essentiel pour la NMT multilingue, qui, malheureusement, a été ignorée par des travaux antérieurs. Dans ce travail, nous développons un cadre qui regroupe les langues en différents groupes et forme un modèle multilingue pour chaque cluster. Nous étudions deux méthodes de regroupement linguistique : (1) en utilisant les connaissances antérieures, où nous regroupons les langues selon la famille de langues, et (2) en utilisant l'intégration linguistique, dans laquelle nous représentons chaque langue par un vecteur d'intégration et les regroupons dans l'espace d'intégration. En particulier, nous obtenons le l'intégration de vecteurs de toutes les langues en formant un modèle universel de traduction automatique neuronale. Nos expériences sur 23 langues montrent que la première méthode de regroupement est simple et facile à comprendre mais conduit à une précision de traduction sous-optimale, tandis que la seconde méthode capture suffisamment la relation entre les langues et améliore la précision de traduction pour presque toutes les langues par rapport aux méthodes de base. La traducción automática neuronal (NMT) multilingüe, que traduce varios idiomas utilizando un solo modelo, es de gran importancia práctica debido a sus ventajas para simplificar el proceso de capacitación, reducir los costos de mantenimiento en línea y mejorar la traducción de bajo recurso y de disparo cero. Dado que hay miles de idiomas en el mundo y algunos de ellos son muy diferentes, es extremadamente oneroso manejarlos todos en un solo modelo o usar un modelo separado para cada par de idiomas. Por lo tanto, dado un presupuesto de recursos fijo, por ejemplo, el número de modelos, cómo determinar qué idiomas deben ser compatibles con un modelo es fundamental para la NMT multilingüe, que, desafortunadamente, ha sido ignorada por trabajos anteriores. En este trabajo, desarrollamos un marco que agrupa los idiomas en diferentes grupos y entrena un modelo multilingüe para cada grupo. Estudiamos dos métodos para la agrupación de idiomas: (1) utilizando el conocimiento previo, donde agrupamos los idiomas de acuerdo con la familia de idiomas, y (2) utilizando la incrustación de idiomas, en la que representamos cada idioma mediante un vector de incrustación y los agrupamos en el espacio de incrustación. En particular, obtenemos el incrustar vectores de todos los idiomas mediante el entrenamiento de un modelo universal de traducción automática neuronal. Nuestros experimentos en 23 idiomas muestran que el primer método de agrupamiento es simple y fácil de entender, pero conduce a una precisión de traducción subóptima, mientras que el segundo método captura bien la relación entre idiomas y mejora la precisión de la traducción para casi todos los idiomas en comparación con los métodos de referencia.

Languages

Licenses

Similaires