Kapitel 12. Datenwissenschaft und R
Diese Arbeit wurde mithilfe von KI übersetzt. Wir freuen uns über dein Feedback und deine Kommentare: translation-feedback@oreilly.com
12.0 Einleitung
Data Science ist eine relativ neue Disziplin, auf die viele erst durch einenArtikel von Mike Loukides von O'Reilly aus dem Jahr 2010 aufmerksam wurden. gibt es viele Definitionen in diesem Bereich, aber Loukides fasst seine detaillierte Beobachtung und Teilnahme an Data Science in dieser Definition zusammen:
Eine Datenanwendung schöpft ihren Wert aus den Daten selbst und erzeugt dadurch mehr Daten. Es ist nicht nur eine Anwendung mit Daten, sondern ein Datenprodukt. Data Science ermöglicht die Erstellung von Datenprodukten.
Eines der wichtigsten Open-Source-Ökosysteme für Data-Science-Software befindet sich bei Apache und umfasstHadoop(mit dem Hadoop Distributed File System [HDFS], Hadoop MapReduce,1 den Objektspeicher Ozone und das Zeitplannungsprogramm YARN), dieverteilte Datenbank Cassandra und die Compute Engine Spark. Eine aktuelle Liste findest du in den Abschnitten Module und Verwandte Projekte auf der Hadoop-Seite.
Interessant dabei ist, dass ein großer Teil dieser Infrastruktur, die von Datenwissenschaftlern als selbstverständlich angesehen wird, in Java und Scala (einer JVM-Sprache) geschrieben ist. Ein großer Teil des Restes ist in Python geschrieben, einer Sprache, die Java ergänzt. Viele Nutzer sehen nur die Python-Seite und merken nicht, dass Java hinter einem Teil der Infrastruktur ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access