5 research outputs found

    The Diachronic Spanish Sonnet Corpus (DISCO): TEI and Linked Open Data Encoding, Data Distribution and Metrical Findings

    Get PDF
    We present a corpus covering 4094 sonnets in Spanish by 1204 authors, from the 15th to the 19th centuries, extracted from HTML sources. The corpus was encoded in TEI. Author metadata not available in a standardized format in the sources were systematically retrieved or inferred from the sources and added to the corpus, e.g. author gender or VIAF IDs. RDFa was used to render TEI semantics in the Linked Open Data paradigm. Scansion was annotated automatically with the ADSO Scansion System. Enjambment was annotated automatically with our enjambment detection tool (ANJA). Stanza types were also annotated. The corpus covers both canonical and non-canonical authors, from Europe and Latin America. The range of authors and periods, the use of both TEI and RDFa for interoperability, and the combination of metrical and enjambment annotations goes beyond previously available digital resources for the study of poetry in Spanish. This corpus is a contribution within an area where digital resources are scarce. We also present some literary analysis results that illustrate the type of research questions that can be answered with the corpus

    The conference "Digital Humanities 2016" as the reflection of the development of digital humanitaristics

    Get PDF
    Цифровая гуманитаристика – одно из актуальных и динамично развивающихся направлений в современной гуманитарной науке, которое зародилось в зарубежном научно-образовательном пространстве и начинает активно развиваться в России. Свидетельством актуальности и востребованности данного направления является большое количество научных мероприятий, проходивших за последние годы. К числу наиболее крупных и значимых мероприятий в этой области следует отнести ежегодную конференцию «Digital humanities», проходящую под эгидой ADHO. Очередной Конгресс состоялся в Кракове (Польша) и собрал 902 участника из 45 стран. Это дает основание рассматривать мероприятие как определенный этап развития DH и позволяет выделить ключевые тенденции его движения

    An OWL 2 Formal Ontology for the Text Encoding Initiative

    No full text

    An OWL 2 Formal Ontology for the Text Encoding Initiative

    No full text
    This paper presents the results of an effort that our research team has done in order to develop an OWL 2 ontology to formally define the semantics of the Text Encoding Initiative markup language. The preliminary steps of this research project have already been presented at the TEI Conference in 2014 and 2015. We believe that our work has reached a satisfactory level of development, both on the theoretical side and in the practical implementation

    Graphdatenbanken für die textorientierten e-Humanities

    Get PDF
    Vor dem Hintergrund zahlreicher Digitalisierungsinitiativen befinden sich weite Teile der Geistes- und Sozialwissenschaften derzeit in einer Transition hin zur großflächigen Anwendung digitaler Methoden. Zwischen den Fachdisziplinen und der Informatik zeigen sich große Differenzen in der Methodik und bei der gemeinsamen Kommunikation. Diese durch interdisziplinäre Projektarbeit zu überbrücken, ist das zentrale Anliegen der sogenannten e-Humanities. Da Text der häufigste Untersuchungsgegenstand in diesem Feld ist, wurden bereits viele Verfahren des Text Mining auf Problemstellungen der Fächer angepasst und angewendet. Während sich langsam generelle Arbeitsabläufe und Best Practices etablieren, zeigt sich, dass generische Lösungen für spezifische Teilprobleme oftmals nicht geeignet sind. Um für diese Anwendungsfälle maßgeschneiderte digitale Werkzeuge erstellen zu können, ist eines der Kernprobleme die adäquate digitale Repräsentation von Text sowie seinen vielen Kontexten und Bezügen. In dieser Arbeit wird eine neue Form der Textrepräsentation vorgestellt, die auf Property-Graph-Datenbanken beruht – einer aktuellen Technologie für die Speicherung und Abfrage hochverknüpfter Daten. Darauf aufbauend wird das Textrecherchesystem „Kadmos“ vorgestellt, mit welchem nutzerdefinierte asynchrone Webservices erstellt werden können. Es bietet flexible Möglichkeiten zur Erweiterung des Datenmodells und der Programmfunktionalität und kann Textsammlungen mit mehreren hundert Millionen Wörtern auf einzelnen Rechnern und weitaus größere in Rechnerclustern speichern. Es wird gezeigt, wie verschiedene Text-Mining-Verfahren über diese Graphrepräsentation realisiert und an sie angepasst werden können. Die feine Granularität der Zugriffsebene erlaubt die Erstellung passender Werkzeuge für spezifische fachwissenschaftliche Anwendungen. Zusätzlich wird demonstriert, wie die graphbasierte Modellierung auch über die rein textorientierte Forschung hinaus gewinnbringend eingesetzt werden kann.In light of the recent massive digitization efforts, most of the humanities disciplines are currently undergoing a fundamental transition towards the widespread application of digital methods. In between those traditional scholarly fields and computer science exists a methodological and communicational gap, that the so-called \\\"e-Humanities\\\" aim to bridge systematically, via interdisciplinary project work. With text being the most common object of study in this field, many approaches from the area of Text Mining have been adapted to problems of the disciplines. While common workflows and best practices slowly emerge, it is evident that generic solutions are no ultimate fit for many specific application scenarios. To be able to create custom-tailored digital tools, one of the central issues is to digitally represent the text, as well as its many contexts and related objects of interest in an adequate manner. This thesis introduces a novel form of text representation that is based on Property Graph databases – an emerging technology that is used to store and query highly interconnected data sets. Based on this modeling paradigm, a new text research system called \\\"Kadmos\\\" is introduced. It provides user-definable asynchronous web services and is built to allow for a flexible extension of the data model and system functionality within a prototype-driven development process. With Kadmos it is possible to easily scale up to text collections containing hundreds of millions of words on a single device and even further when using a machine cluster. It is shown how various methods of Text Mining can be implemented with and adapted for the graph representation at a very fine granularity level, allowing the creation of fitting digital tools for different aspects of scholarly work. In extended usage scenarios it is demonstrated how the graph-based modeling of domain data can be beneficial even in research scenarios that go beyond a purely text-based study