Wat is Hadoop en hoe werkt het?
Grote hoeveelheden data verdeeld opslaan en verwerken
Hadoop is een open-source framework van de Apache Software Foundation voor het gedistribueerd opslaan en verwerken van grote hoeveelheden data. In plaats van alle gegevens en rekenkracht op één systeem te concentreren, kan Hadoop het werk verdelen over meerdere computers binnen een cluster.
Hierdoor kan Hadoop worden gebruikt voor datasets die omvangrijk zijn of waarbij verwerking over meerdere systemen gewenst is. Hadoop bestaat uit verschillende componenten voor onder andere opslag, verwerking en het verdelen van beschikbare rekenkracht.
Hoe werkt Hadoop?
Data en verwerking verdelen over een cluster
Een belangrijk uitgangspunt van Hadoop is gedistribueerde verwerking. Data kan over meerdere systemen worden opgeslagen, waarna verwerking eveneens over verschillende onderdelen van het cluster kan worden verdeeld.
Het Hadoop Distributed File System, beter bekend als HDFS, verzorgt de gedistribueerde opslag. HDFS is ontworpen voor grote datasets en hoge doorvoersnelheden. Gegevens worden verdeeld binnen het cluster en Hadoop is ingericht om met uitval van afzonderlijke onderdelen om te kunnen gaan.
Voor het uitvoeren en verdelen van verwerking beschikt Hadoop onder meer over YARN en MapReduce. YARN beheert resources en de planning van werkzaamheden binnen het cluster. MapReduce maakt het mogelijk grote datasets parallel te verwerken.
Uit welke onderdelen bestaat Hadoop?
HDFS, YARN, MapReduce en Hadoop Common
Apache Hadoop bestaat uit verschillende kerncomponenten die ieder een eigen technische functie hebben:
- Hadoop Common: gedeelde bibliotheken en hulpmiddelen die door andere Hadoop-componenten worden gebruikt.
- HDFS: het gedistribueerde bestandssysteem voor de opslag van grote datasets.
- Hadoop YARN: verzorgt resource management en het plannen en bewaken van werkzaamheden binnen een cluster.
- Hadoop MapReduce: een systeem waarmee grote datasets parallel kunnen worden verwerkt.
Deze onderdelen vormen samen de technische basis waarop gegevens over meerdere systemen kunnen worden opgeslagen en verwerkt.
Waarvoor wordt Hadoop gebruikt?
Hadoop binnen big data en dataverwerking
Hadoop is ontwikkeld voor situaties waarin grote hoeveelheden gegevens verdeeld moeten worden opgeslagen of verwerkt. MapReduce is bijvoorbeeld ontworpen voor de parallelle verwerking van datasets die tot meerdere terabytes kunnen omvatten en over grote clusters kunnen worden verdeeld.
Toepassingen kunnen onder meer liggen bij:
- verwerking van grote datasets;
- batchverwerking van data;
- gedistribueerde gegevensopslag;
- verwerking van log- en eventdata;
- dataplatforms met meerdere gegevensbronnen;
- technische oplossingen voor data-analyse;
- voorbereiding of verwerking van data voor andere softwaretoepassingen.
Welke technische inrichting passend is, hangt af van de hoeveelheid data, de gewenste verwerking en de bestaande softwareomgeving.
Wat is het verschil tussen Hadoop en een database?
Hadoop is geen traditionele database
Hadoop wordt soms omschreven als een grote database, maar technisch gezien klopt dat niet. Hadoop is een framework met verschillende componenten voor gedistribueerde opslag, resource management en dataverwerking. HDFS is daarbij een bestandssysteem en MapReduce is bedoeld voor parallelle gegevensverwerking.
Een traditionele relationele database is doorgaans ingericht om gestructureerde gegevens op te slaan en deze bijvoorbeeld met queries op te vragen en bij te werken. Hadoop heeft een andere technische opzet en kan worden ingezet wanneer datasets en verwerkingswerkzaamheden over meerdere systemen moeten worden verdeeld.
Hadoop en databases kunnen daardoor ook naast elkaar binnen een software- of dataomgeving worden gebruikt.
Waarom wordt Hadoop gebruikt voor big data?
Data verwerken wanneer volumes blijven groeien
Bij grote hoeveelheden data kan verwerking op één systeem steeds zwaarder worden. Hadoop maakt het mogelijk om opslag en verwerking over meerdere systemen binnen een cluster te verdelen. Daardoor is de technologie geschikt voor toepassingen waarin grote datasets periodiek of op grote schaal moeten worden verwerkt.
De capaciteit van een Hadoop-omgeving kan worden uitgebreid door extra systemen aan het cluster toe te voegen. Hierdoor kan Hadoop meegroeien met toenemende hoeveelheden data en verwerkingswerkzaamheden.
Hadoop gebruiken binnen maatwerksoftware?
Technische ontwikkeling rond data en software
Wanneer grote hoeveelheden data onderdeel zijn van een softwaretoepassing, kan een technologie zoals Hadoop onderdeel worden van de technische oplossing. De keuze daarvoor is afhankelijk van de functionele en technische eisen, de hoeveelheid gegevens en de omgeving waarin de software moet functioneren.
APPelit verzorgt de technische realisatie van maatwerksoftware en data-intensieve toepassingen op basis van de afgesproken functionaliteiten en beschikbare input van de opdrachtgever.
Daarbij kunnen onder andere softwarecomponenten worden ontwikkeld voor het verwerken, ontsluiten en gebruiken van gegevens binnen applicaties. Wanneer Hadoop onderdeel is van de afgesproken technische oplossing, kan deze technologie binnen de softwareontwikkeling worden toegepast.
Wilt u software laten ontwikkelen waarin grote hoeveelheden data moeten worden verwerkt? Neem contact op met APPelit om de technische mogelijkheden voor uw toepassing te bespreken.
Ervaar het gemak van onze service!
Wilt u dat wij contact opnemen? Vul het formulier hieronder in en we bellen u terug.
U kunt ook meer informatie achterlaten via onze contactpagina of het offerteformulier
Ervaar het gemak van onze service!
Wilt u dat wij contact opnemen? Vul het formulier hieronder in en we bellen u terug.
U kunt ook meer informatie achterlaten via onze contactpagina of het offerteformulier
