211,951 research outputs found

    New Methods, Current Trends and Software Infrastructure for NLP

    Full text link
    The increasing use of `new methods' in NLP, which the NeMLaP conference series exemplifies, occurs in the context of a wider shift in the nature and concerns of the discipline. This paper begins with a short review of this context and significant trends in the field. The review motivates and leads to a set of requirements for support software of general utility for NLP research and development workers. A freely-available system designed to meet these requirements is described (called GATE - a General Architecture for Text Engineering). Information Extraction (IE), in the sense defined by the Message Understanding Conferences (ARPA \cite{Arp95}), is an NLP application in which many of the new methods have found a home (Hobbs \cite{Hob93}; Jacobs ed. \cite{Jac92}). An IE system based on GATE is also available for research purposes, and this is described. Lastly we review related work.Comment: 12 pages, LaTeX, uses nemlap.sty (included

    Learning to harvest information for the semantic web

    Get PDF
    This work was carried out within the AKT project (www.aktors.org), sponsored by the UK Engineering and Physical Sciences Research Council (grant GR/N15764/01), and the Dot.Kom project (www.dot-kom.org), sponsored by the EU IST asp part of Framework V (grant IST-2001-34038).In this paper we describe a methodology for harvesting in- formation from large distributed repositories (e.g. large Web sites) with minimum user intervention. The methodology is based on a combination of information extraction, information integration and machine learning techniques. Learning is seeded by extracting information from structured sources (e.g. databases and digital libraries) or a user-defined lexicon. Retrieved information is then used to partially annotate documents. An- notated documents are used to bootstrap learning for simple Information Extraction (IE) methodologies, which in turn will produce more annotation to annotate more documents that will be used to train more complex IE engines and so on. In this paper we describe the methodology and its implementation in the Armadillo system, compare it with the current state of the art, and describe the details of an implemented application. Finally we draw some conclusions and highlight some challenges and future work.peer-reviewe

    Applying a Framework for Software Development Methods in an Information Systems Curriculum

    Get PDF
    Software developers are constantly exploring new software development methods that are timely and cost effective, and also foster productivity and better quality systems. A Software Development Method (SDM) is a system of technical procedures and notational conventions for the organized construction of software [Karam and Casselman p. 34]. Karam and Casselman [1] provide a framework for evaluating SDMs within an organization. There are 14 technical properties, 5 usage properties and 2 managerial properties. Is this framework viable for cataloging SDMs in an academic setting, thereby providing guidelines for selecting an appropriate software development methodology for an Information Systems curriculum? The main purpose of this paper is to demonstrate the use of a cataloging framework for SDMs within a business Information Systems curriculum. Information Engineering (IE) and Software Engineering (SE) are SDMs used to illustrate the usage of framework. The framework can be expanded to include additional SDMs. The Washington Post (February 24, 1993) forecasts a 78% increase in the demand for system analysts within the next 10 years. It is important for Information Systems\u27 graduates to know state of the art techniques, and therefore, courses must constantly be updated to meet this demand

    Δομημένη εξαγωγή πληροφοριών από σελίδες ιατρικών και διατροφικών δεδομένων με χρήση του Information Extraction

    Get PDF
    106 σ.Αντικείμενο της παρούσας διπλωματικής εργασίας αποτελεί η μελέτη και εφαρμογή μεθόδων για την εξαγωγή πληροφοριών (Ιnformation Extraction, IE) από κείμενα σχετικά με ιατρικοφαρμαευτικά και διατροφικά δεδομένα και τη δομημένη παρουσίασή τους σε μορφή html πινάκων. Γίνεται, επίσης, χρήση ενός λογισμικού που διατίθεται ελέυθερα στους χρήστες (GATE), καθώς και ενός συνόλου κανόνων και γραμματικών (JAPE) που υποβοηθούν στον εντοπισμό των δεδομένων που ζητούνται. Παρουσιάζεται, παράλληλα, μία εφαρμογή (pipeline) που είναι σχεδιασμένη κατάλληλα για να τρέχει πάνω σε ένα σύνολο εγγράφων (corpus) και να δημιουργεί ένα σύνολο σχολιασμών (annotations). Τέλος, εφαρμόζεται ένα στάδιο που λαμβάνει τα αποτελέσματα της εφαρμογής και τα κατηγοριοποιεί στην επιθυμητή μορφή. Η εργασία στο συνολό της περιλαμβάνει πέρα από ένα γενικό θεωρητικό υπόβαθρο, τη χρήση ειδικών διαδραστικών περιβαλλόντων (Integrated Development Environment, IDE) απαραίτητων για την επίτευξη του αρχικού στόχου. Στο κεφάλαιο 1, γίνεται μια γενική εισαγωγή σε τρόπους επεξεργασίας φυσικών γλωσσών (Natural Language Processing, NLP) εισάγωντας το γενικότερο πλαίσιο στο οποίο θα κινηθεί η εν λόγω εργασία. Προσδιορίζονται, επίσης, και έννοιες απαραίτητες για τη συνέχεια, όπως αυτή της εξαγωγής δεδομένων (IE). Στο κεφάλαιο 2, παρουσιάζεται το κυριότερο θεωρητικό υπόβαθρο της εργασίας, καθώς περιλαμβάνει την ανάλυση του GATE, ενός συστηματος λογισμικού στο οποίο θα στηριχθεί η εξαγωγή των δεδομένων μας. Περιλαμβάνει, ακόμα, και την ανάλυση του διαδραστικού περιβάλλοντος του GATE (GATE Developer) και του ΙΕ συστήματός του (ANNIE), που θα χρησιμοποιηθούν στη συνέχεια. Στο κεφάλαιο 3, περιγράφεται σε θεωρητικό επίπεδο η γλώσσα που παράγει τους σχολιασμούς κειμένων με χρήση ειδικών κανόνων και γραμματικών. Αποτελεί ένα βασικό εργαλείο για τη δημιουργία της εφαρμογής που θα εξάγει τα δεδομένα. Στο κεφάλαιο 4, προσδιορίζεται ο τρόπος σύνδεσης όλων των ανώτερων στοιχείων και πληροφοριών για τη δημιουργία της εφαρμογής που επιτυγχάνει τον τελικό στόχο. Αναφέρεται, δηλαδή, σε ένα αναλυτικό βαθμό ο τρόπος σχεδιασμού της εφαρμογής, παρουσιάζοντας ταυτόχρονα τμήματα κώδικα προγραμματισμού της και αποτελέσματα από την εκτελεσή της. Στο κεφάλαιο 5, γίνεται μία γενική σύνοψη της εργασίας , προβολή συμπερασμάτων που προέκυψαν, καθώς και προτροπή νέων ιδεών για μελλοντική ανάπτυξη της δουλειάς που παρουσιάστηκε.The purpose of this diploma thesis is the design and implementation of methods that achieve Information Extraction (IE) from texts, relevant to biomedical and nutritional data and their structured presentation in html tables. Additionally, an open-source software for text engineering (GATE) is used, and a set of rules and grammars (JAPE) to assist in identifying the requested data. Furthermore, an application (pipeline) is utilized that is designed especially to run on a set of documents (corpus) and create a set of annotations that facilitate superior work. A final stage is applied, that takes the results of the above application and categorizes them in a desired form. The document includes apart from a theoretical background review of the basic concepts involved in the aforementioned tool flow, the description of the use of special Integrated Development Environments (IDEs) necessary to achieve the original goal. In Chapter 1, a general introduction is made, covering the field of Natural Language Processing (NLP), providing motivation for this work. Moreover, lots of necessary concepts, such as the Information extraction (IE) are determined, critical for the comprehension of the rest of the chapters. Chapter 2 presents the main theoretical background of the entire diploma thesis, as it involves the analysis of GATE, a general architecture of text engineering which will support the information extraction of our data. It also includes the analysis of the integrated development environment of GATE (GATE Developer) and the information extraction system of GATE (ANNIE), which will be subsequently used. Chapter 3 describes the way of creating text annotations using the Java Annotation Pattern Engine (JAPE). It is an essential tool for the creation of our application which will perform the IE. In Chapter 4, we analyze the way of connecting all data and information mentioned, to create the application that achieves the ultimate goal. Additionally, a detailed process of the application design is highlighted, while presenting snippets of its code and results of its execution. In Chapter 5, the diploma thesis is summarised, giving conclusions and introducing new ideas for further development of the presented work.Γεώργιος Δ. Παντερή
    corecore