International audience
La classification automatique des documents textes arabes devient nécessaire à cause du volume de documents arabes échangés et stockés sur support électronique. Ce travail s'inscrit dans une étude comparative des méthodes de classification non supervisée , dite clustering , des documents arabes ainsi des différentes approches de lemmatisation (stemming), de la langue arabe, et de représentation des textes afin d'améliorer la qualité de clustering.Dans ce travail nous avons implémenté trois algorithmes de clustering des documents textes, (kmeans, k-means++ et classification hiérarchiqueascendante) effectuant un clustering dur où chaque document ne peut appartenir qu’à un et un seul document. Enfin nous avons évalué nos algorithmes suivant plusieurs critères afin de comparer entre eux. Nos évaluations montrent que chaque algorithme a ses limites et ses avantages, et que beaucoup de travaux doivent être réalisé pour augmenter la qualité de clustering des documents textes arabes.