2 research outputs found

    Detección automática de Spam utilizando Regresión Logística Bayesiana

    Get PDF
    Este artículo presenta un sistema de detección automática de Spam, o correo no deseado, aplicando Regresión Logística Bayesiana (BBR) como técnica de aprendizaje automático, sobre la colección de correos electrónicos SPAMBASE. A modo de comparativa se han aplicado otros dos algoritmos de aprendizaje: el algoritmo SVM (Support Vector Machine), y el algoritmo PLAUM (Perceptron Algorithm with Uneven Margins). La finalidad de este estudio es comprobar la eficiencia y efectividad del algoritmo BBR en la tarea concreta de filtrado de Spam. Como muestran los experimentos, el algoritmo BBR no solo obtiene unos resultados satisfactorios en cuanto a precisión y recall, sino que además es el algoritmo más rápido de los estudiados.This paper presents an Spam automatic detection system using Bayesian Logistic Regression (BBR) as machine learning algorithm, over the SPAMBASE collection. We have also used two machine learning algorithms: SVM and PLAUM, in order to compare the results. Our aim is to check the efficiency and effectiveness of the BBR method. The obtained results show good results in terms of precision and recall. We have also noticed that BBR is the faster algorithm.Este trabajo ha sido financiado con el proyecto (MCYT) TIC-2003-07158-C04-04

    Generación de recursos para Análisis de Opiniones en español

    Get PDF
    [ES] El Análisis de Sentimientos (AS) se refiere al tratamiento de la información subjetiva en los textos, sobretodo comentarios u opiniones personales. Una de las tareas básicas de AS es la clasificación de la polaridad de un texto determinado en un documento o frase, es decir, si la opinión expresada es positiva, negativa o neutra. Mucho se ha investigado en la clasificación de polaridad en documentos escritos en inglés. Sin embargo, actualmente cada vez más personas expresan comentarios u opiniones en su propio idioma. Para llevar a cabo esta labor es necesario el uso de los recursos lingüísticos (lexicones y corpora) que son escasos, cuando no inexistentes, en idiomas distintos al inglés. Por tales circunstancias, esta tesis tiene como objetivo la generación de nuevos recursos para el AS en español, tercer idioma con más relevancia en la web 2.0.[EN] Sentiment Analysis (SA) refers to the treatment of the subjective information in texts, product reviews, comments on blogs or personal opinions. One of the basic tasks in SA is classifying the polarity of a given text in a document, i.e., whether the opinion expressed is positive, negative, or neutral. Many studies have investigated the polarity classification in documents written in English. However, nowadays more and more people express their comments, opinions or points of view in their own language. For this reason, it is necessary to develop systems than can extract and analyze all this information in different languages. In this work we focus on polarity detection for Spanish reviews. We are mainly concerned with linguistic resources for Spanish sentiment analysis because, in addition to the lack of resources for this language in this area, it is currently the third most used language in the web 2.0.Tesis Univ. Jaén. Departamento de Informática- Leída el 28 de noviembre de 201