Implementierung von Software-Frameworks am Beispiel von Apache Spark in das DBpediaExtraction Framework

Bielinski, Robert

Implementierung von Software-Frameworks am Beispiel von Apache Spark in das DBpediaExtraction Framework

Authors: Robert Bielinski
Publication date: 28 August 2018
Publisher

Abstract

Das DBpedia-Projekt extrahiert zweimal pro Jahr RDF-Datensätze aus den semi-\\strukturierten Datensätzen Wikipedias. DBpedia soll nun auf ein Release-Modell umgestellt werden welches einen Release-Zyklus mit bis zu zwei vollständigen DBpedia Datensätzen pro Monat unterstützt. Dies ist mit der momentanen Geschwindigkeit des Extraktionsprozesses nicht möglich. Eine Verbesserung soll durch eine Parallelisierung mithilfe von Apache Spark erreicht werden. Der Fokus dieser Arbeit liegt auf der effizienten lokalen Nutzung Apache Sparks zur parallelen Verarbeitung von großen, semi-strukturierten Datensätzen. Dabei wird eine Implementierung der Apache Spark gestützten Extraktion vorgestellt, welche eine ausreichende Verringerung der Laufzeit erzielt. Dazu wurden grundlegende Methoden der komponentenbasierten Softwareentwicklung angewendet, Apache Sparks Nutzen für das Extraction-Framework analysiert und ein Überblick über die notwendigen Änderungen am Extraction-Framework präsentiert

Similar works

Full text

Open in the Core reader

Download PDF

Available Versions

Qucosa - Publikationsserver der Universität Leipzig

oai:qucosa:de:qucosa:31355

Last time updated on 03/09/2019