Logo Lanfrica

Performance evaluation of Latent Dirichlet Allocation on legal documents تقييم أداء تخصيص ديريتشليت الكامن في المستندات القانونية Évaluation de la performance de l'allocation de Dirichlet latent sur les documents juridiques Evaluación del desempeño de la asignación latente de Dirichlet en documentos legales

Domaine:

natural language processing

Type de record:

paper
Créateur:
A.OAhmOliE.
Éditeur:
Ope
Hôte:avatar
Latent Dirichlet Allocation (LDA) is an algorithm with the capability of processing large amount of text data. In this study, the LDA is used to produce topic modelling of topic clusters from corpus of legal texts generated under 4 topics within Nigeria context Employment Contract, Election Petition, Deeds, and Articles of Incorporation. Each topic has a substantial number of articles and the LDA method proves effective in extracting topics and generating index words that are in each topic cluster. At the end of experimentation, results are compared with manually pre-annotated dataset for validation purpose and the results show high accuracy. The LDA output shows optimal performance in the word indexing processing for Election Petition as all the documents annotated under the topic were accurately classified. تخصيص ديريتشليت الكامن (LDA) هو خوارزمية ذات قدرة على معالجة كمية كبيرة من البيانات النصية. في هذه الدراسة، يتم استخدام LDA لإنتاج نمذجة موضوعية لمجموعات الموضوعات من مجموعة النصوص القانونية التي تم إنشاؤها تحت 4 مواضيع في سياق نيجيريا عقد العمل، عريضة الانتخاب، السندات، ومواد التأسيس. يحتوي كل موضوع على عدد كبير من المقالات وتثبت طريقة LDA فعاليتها في استخراج الموضوعات وتوليد كلمات الفهرسة الموجودة في كل مجموعة مواضيع. في نهاية التجربة، تتم مقارنة النتائج مع مجموعة البيانات التي تم تدوينها مسبقًا يدويًا لغرض التحقق من الصحة وتظهر النتائج دقة عالية. يُظهر مخرج LDA الأداء الأمثل في معالجة فهرسة الكلمات لعريضة الانتخابات حيث تم تصنيف جميع المستندات المشروحة تحت الموضوع بدقة. L'allocation de Dirichlet latent (LDA) est un algorithme capable de traiter une grande quantité de données textuelles. Dans cette étude, la LDA est utilisée pour produire une modélisation thématique de groupes de sujets à partir d'un corpus de textes juridiques générés sous 4 sujets dans le contexte nigérian du contrat de travail, de la pétition électorale, des actes et des statuts. Chaque sujet a un nombre important d'articles et la méthode LDA s'avère efficace pour extraire des sujets et générer des mots d'index qui se trouvent dans chaque groupe de sujets. À la fin de l'expérimentation, les résultats sont comparés à un ensemble de données préannotées manuellement à des fins de validation et les résultats montrent une grande précision. La sortie LDA montre des performances optimales dans le traitement d'indexation des mots pour les pétitions électorales, car tous les documents annotés sous le sujet ont été classés avec précision. La asignación latente de Dirichlet (LDA) es un algoritmo con la capacidad de procesar una gran cantidad de datos de texto. En este estudio, el LDA se utiliza para producir modelos temáticos de grupos temáticos a partir de un corpus de textos legales generados en 4 temas dentro del contexto de Nigeria Contrato de empleo, Petición de elección, Escrituras y Artículos de incorporación. Cada tema tiene un número considerable de artículos y el método LDA resulta eficaz para extraer temas y generar palabras índice que se encuentran en cada grupo de temas. Al final de la experimentación, los resultados se comparan con el conjunto de datos previamente anotados manualmente para fines de validación y los resultados muestran una alta precisión. El resultado de LDA muestra un rendimiento óptimo en el procesamiento de indexación de palabras para la petición de elección, ya que todos los documentos anotados bajo el tema se clasificaron con precisión.

Languages

Licenses

Similaires