Search CORE

3 research outputs found

Évaluation intrinsèque et extrinsèque du nettoyage de pages Web

Author: Brixtel Romain
Lecluze Charlotte
Lejeune Gaël
Publication venue: HAL CCSD
Publication date: 22/06/2015
Field of study

International audienceIn this article, we tackle the problem of evaluation of web page cleaning tools. This task is seldom studied in the literature although it has consequences on the linguistic processing performed on web-based corpora. We propose two types of evaluation : (I) an intrinsic (content-based) evaluation with measures on words, tags and characters ; (II) an extrinsic (task-based) evaluation on the same corpus by studying the effects of the cleaning step on the performances of an NLP pipeline. We show that the results are not consistent in both evaluations. We show as well that there are important differences in the results between the studied languages. We conclude that the choice of a web page cleaning tool should be made in view of the aimed task rather than on the performances of the tools in an intrinsic evaluation.Le nettoyage de documents issus du web est une tâche importante pour le TAL en général et pour la constitution de corpus en particulier. Cette phase est peu traitée dans la littérature, pourtant elle n'est pas sans influence sur la qualité des informations extraites des corpus. Nous proposons deux types d'évaluation de cette tâche de détourage : (I) une évaluation intrinsèque fondée sur le contenu en mots, balises et caractères ; (II) une évaluation extrinsèque fondée sur la tâche, en examinant l'effet du détourage des documents sur le système placé en aval de la chaîne de traitement. Nous montrons que les résultats ne sont pas cohérents entre ces deux évaluations ainsi qu'entre les différentes langues. Ainsi, le choix d'un outil de détourage devrait être guidé par la tâche visée plutôt que par la simple évaluation intrinsèque

HAL - Normandie Université

HAL Descartes

Évaluation intrinsèque et extrinsèque du nettoyage de pages Web

Author: Brixtel Romain
Lecluze Charlotte
Lejeune Gaël
Publication venue: HAL CCSD
Publication date: 22/06/2015
Field of study

HAL Descartes

Évaluation intrinsèque et extrinsèque du nettoyage de pages Web

Author: Brixtel Romain
Lecluze Charlotte
Lejeune Gaël
Publication venue: HAL CCSD
Publication date: 22/06/2015
Field of study

HAL - Normandie Université