Einstieg in Big Data: Konzepte, Technologien und Praxis
Dieses Buch bietet einen umfassenden und praxisnahen Überblick über den Umgang mit großen Datenmengen. Es erklärt verständlich die zentralen Konzepte von Big Data und zeigt sowohl deren Möglichkeiten als auch ihre Grenzen auf. Dabei wird dargestellt, wie Daten in skalierbaren NoSQL-Systemen gespeichert und mit verschiedenen Verfahren der verteilten Verarbeitung analysiert werden können. Neben klassischen Batch-Verfahren werden auch Micro-Batch- und moderne Streaming-Ansätze vorgestellt. Darüber hinaus beschreibt das Buch, wie moderne Datenplattformen entwickelt werden und wie sich diese durch den Einsatz von Künstlicher Intelligenz erweitern lassen.
Grundlagen und Herausforderungen von Big Data
Zu Beginn werden die grundlegenden Herausforderungen behandelt, die entstehen, wenn Datenmengen so groß werden, dass sie nicht mehr auf einem einzelnen Rechner verarbeitet werden können. In solchen Fällen ist eine verteilte Datenverarbeitung erforderlich, bei der Daten und Rechenaufgaben auf mehrere Systeme verteilt werden. Das Buch erläutert, welche technischen und organisatorischen Anforderungen sich daraus ergeben und welche Lösungsansätze in der Praxis eingesetzt werden.
Verarbeitungsparadigmen und Datenspeicherung
Ein Schwerpunkt liegt auf den verschiedenen Paradigmen der Datenverarbeitung. Leserinnen und Leser lernen, wie Big-Data-Analysen mit Batch-, Micro-Batch- und Stream-Verarbeitung umgesetzt werden können und in welchen Situationen sich die jeweiligen Ansätze besonders eignen. Ergänzend dazu wird die Datenspeicherung mit NoSQL-Datenbanken erklärt. Dabei werden sowohl die Vorteile – etwa hohe Skalierbarkeit und flexible Datenmodelle – als auch mögliche Nachteile dieser Systeme betrachtet.
Praxisnahe Umsetzung mit modernen Technologien
Die Autoren verfolgen einen praxisorientierten Ansatz. Viele Beispiele werden mit gängigen Open-Source-Werkzeugen umgesetzt und nutzen moderne Container-Technologien wie Docker. Dadurch können Leserinnen und Leser die vorgestellten Konzepte direkt ausprobieren und auf eigene Projekte übertragen. Gleichzeitig wird gezeigt, dass sich die erlernten Methoden auch problemlos auf kommerzielle Produkte übertragen lassen.
Erweiterte Themen und Systemarchitekturen
Neben der Datenverarbeitung werden auch weitere wichtige Aspekte moderner Datenplattformen behandelt. Dazu gehören die Visualisierung von Analyseergebnissen, der Einsatz zufallsbasierter Algorithmen im Big-Data-Kontext sowie Referenzarchitekturen für den Aufbau skalierbarer Big-Data-Systeme.
Durch diese Kombination aus Grundlagenwissen, praktischen Beispielen und architektonischen Konzepten eignet sich das Buch sowohl als Lehrbuch für Studium und Ausbildung als auch als Nachschlagewerk für die berufliche Praxis.
Aus dem Inhalt
- Verteilte Systeme
- Big-Data-Management
- Data Warehouse, Data Lake(house), Data Mesh
- NoSQL
- Verarbeitungsparadigmen
- Systemarchitekturen
- Algorithmen und Datenanalyse
- Visualisierung
- Systementwicklung, -test und –betrieb
- KI-Anwendungen
Big Data – zu Deutsch „große Datenmengen“ – hat bereits heute ein unvorstellbares Ausmaß angenommen. In dieser Leseprobe verdeutlichen die Autoren die im Jahr 2025 produzierte Datenmenge von geschätzten 175 ZB.
Doch auch wenn Daten oft als das „Öl des 21. Jahrhunderts“ bezeichnet werden, sind sie trotz ihrer schieren Menge in ihrer Rohform nutzlos. Wie Öl müssen sie erst aufbereitet („raffiniert“). werden, um sinnvolle Informationen und Schlüsse aus ihnen zu ziehen.
Wer hat's geschrieben?
Oliver Hummel lebt in der Pfalz und lehrt seit 2017 als Professor für Big Data an der Technischen Hochschule Mannheim, wo er auch das Gründungszentrum leitet. In den Jahren davor war er als CTO verantwortlich für die Entwicklung einer hochskalierbaren Datenvernetzungsplattform in einem gewachsenen Startup. Weitere berufliche Stationen umfassen eine Vertretungsprofessur am KIT sowie eine Juniorprofessur an der Universität Mannheim, beide im Bereich Softwaretechnik. Nach der Promotion in Mannheim arbeitete Oliver Hummel als Consultant an der Entwicklung von Systemen zur Datenanalyse in großen Konzernen mit. Er studierte Angewandte Informatik an der RPTU Kaiserslautern und schrieb seine Diplomarbeit am dort ansässigen Deutschen Forschungszentrum für Künstliche Intelligenz (DFKI).
Dr. Marcus Kessel (derzeit Akademischer Rat) ist promovierter Informatiker der Universität Mannheim, aktuell als Habilitant im Bereich Software Engineering tätig. Seine Forschung konzentriert sich auf die Entwicklung skalierbarer, verhaltensbewusster, laufzeitorientierter Methoden zur Analyse großer Software-Code-Repositorien – das sogenannte „Big Code“. Dabei verbindet er Erkenntnisse aus statischer und dynamischer Programm- und Software-Testing-Analyse mit datengetriebenen Ansätzen der Data-Science.
Beate Navarro ist seit 2021 Professorin für Data Science und Datenbanksysteme an der Technischen Hochschule Ingolstadt. Ihre fachlichen Schwerpunkte liegen in der praxisnahen Vermittlung moderner Datenbanktechnologien und datenanalytischer Verfahren. Zuvor war sie in verschiedenen Positionen in der Wirtschaft im Bereich Data Warehouse und Datenanalyse tätig. Ihre Promotion absolvierte sie an der Julius-Maximilians-Universität Würzburg an der Fakultät für Informatik mit den Schwerpunkten Information Retrieval und Data Mining in Web-2.0-Systemen. Studiert hat sie Wirtschaftsinformatik im dualen Studium in Stuttgart sowie an der Humboldt-Universität zu Berlin. Heute lebt sie mit ihrer Familie in der Nähe von Ingolstadt.
Robert Butscher ist seit 2022 Professor für Wirtschaftsinformatik, insbesondere Business Intelligence und Data Analytics, an der Technischen Hochschule Würzburg-Schweinfurt (THWS). Zuvor war er viele Jahre bei der IT-Genossenschaft DATEV eG für Analytics-Produkte und den Aufbau datengetriebener Geschäftsmodelle verantwortlich. Er studierte Betriebswirtschaftslehre an der Friedrich-Alexander-Universität Erlangen-Nürnberg und promovierte dort in Wirtschaftsinformatik zum Thema „Text Mining in der Konsumentenforschung unter besonderer Berücksichtigung von Produktontologien“. Robert Butscher lebt in Nürnberg, ist verheiratet und (stolzer) Vater von zwei Teenagern.

