Logo Lanfrica
  • Home
  • Atlas
  • Insights
  • Docs
  • Sign in

© 2026 Lanfrica. All rights reserved. All copyrights of the resources shown on the Lanfrica website belong to the original copyright holders, unless explicitly stated otherwise.

Constitution d'un corpus de la langue Arabe à partir du Web

Domain:

natural language processing

Record type:

paperdataset
Creator:
MefSmaLas
Editor:
LabAna
Publisher:
CCSD
Host:avatar
International audience La toile est une source intarissable de données textuelles. Ces dernières années la communauté travaillant sur les différents aspects de la langue s'est tournée vers le web afin de bénéficier de cette masse impressionnante d'informations. Cet article décrit un outil de construction de corpus pour l'Arabe. Il permet de recueillir automatiquement une liste de sites dédiés à la langue Arabe. Ensuite le contenu de ces sites est extrait et est normalisé. Le corpus ainsi constitué peut être utilisé dans diverses applications de traitement du langage naturel et plus particulièrement dans le calcul de modèles de langage statistiques.

Visit

inria.hal.science

Tasks

language modeling

Tags

Langue ArabeWebcorpusmoteur de recherchemodèle de langage statistique[INFO.INFO-CL]Computer Science [cs]/Computation and Language [cs.CL]