Wat is Hadoop en hoe werkt het?

Grote hoeveelheden data verdeeld opslaan en verwerken

Hadoop is een open-source framework van de Apache Software Foundation voor het gedistribueerd opslaan en verwerken van grote hoeveelheden data. In plaats van alle gegevens en rekenkracht op één systeem te concentreren, kan Hadoop het werk verdelen over meerdere computers binnen een cluster.

Hierdoor kan Hadoop worden gebruikt voor datasets die omvangrijk zijn of waarbij verwerking over meerdere systemen gewenst is. Hadoop bestaat uit verschillende componenten voor onder andere opslag, verwerking en het verdelen van beschikbare rekenkracht.

Hoe werkt Hadoop?

Data en verwerking verdelen over een cluster

Een belangrijk uitgangspunt van Hadoop is gedistribueerde verwerking. Data kan over meerdere systemen worden opgeslagen, waarna verwerking eveneens over verschillende onderdelen van het cluster kan worden verdeeld.

Het Hadoop Distributed File System, beter bekend als HDFS, verzorgt de gedistribueerde opslag. HDFS is ontworpen voor grote datasets en hoge doorvoersnelheden. Gegevens worden verdeeld binnen het cluster en Hadoop is ingericht om met uitval van afzonderlijke onderdelen om te kunnen gaan.

Voor het uitvoeren en verdelen van verwerking beschikt Hadoop onder meer over YARN en MapReduce. YARN beheert resources en de planning van werkzaamheden binnen het cluster. MapReduce maakt het mogelijk grote datasets parallel te verwerken.

hadoop-ecosysteem

Uit welke onderdelen bestaat Hadoop?

HDFS, YARN, MapReduce en Hadoop Common

Apache Hadoop bestaat uit verschillende kerncomponenten die ieder een eigen technische functie hebben:

  • Hadoop Common: gedeelde bibliotheken en hulpmiddelen die door andere Hadoop-componenten worden gebruikt.
  • HDFS: het gedistribueerde bestandssysteem voor de opslag van grote datasets.
  • Hadoop YARN: verzorgt resource management en het plannen en bewaken van werkzaamheden binnen een cluster.
  • Hadoop MapReduce: een systeem waarmee grote datasets parallel kunnen worden verwerkt.

Deze onderdelen vormen samen de technische basis waarop gegevens over meerdere systemen kunnen worden opgeslagen en verwerkt.

Waarvoor wordt Hadoop gebruikt?

Hadoop binnen big data en dataverwerking

Hadoop is ontwikkeld voor situaties waarin grote hoeveelheden gegevens verdeeld moeten worden opgeslagen of verwerkt. MapReduce is bijvoorbeeld ontworpen voor de parallelle verwerking van datasets die tot meerdere terabytes kunnen omvatten en over grote clusters kunnen worden verdeeld.

Toepassingen kunnen onder meer liggen bij:

  • verwerking van grote datasets;
  • batchverwerking van data;
  • gedistribueerde gegevensopslag;
  • verwerking van log- en eventdata;
  • dataplatforms met meerdere gegevensbronnen;
  • technische oplossingen voor data-analyse;
  • voorbereiding of verwerking van data voor andere softwaretoepassingen.

Welke technische inrichting passend is, hangt af van de hoeveelheid data, de gewenste verwerking en de bestaande softwareomgeving.

Remote developers

Wat is het verschil tussen Hadoop en een database?

Hadoop is geen traditionele database

Hadoop wordt soms omschreven als een grote database, maar technisch gezien klopt dat niet. Hadoop is een framework met verschillende componenten voor gedistribueerde opslag, resource management en dataverwerking. HDFS is daarbij een bestandssysteem en MapReduce is bedoeld voor parallelle gegevensverwerking.

Een traditionele relationele database is doorgaans ingericht om gestructureerde gegevens op te slaan en deze bijvoorbeeld met queries op te vragen en bij te werken. Hadoop heeft een andere technische opzet en kan worden ingezet wanneer datasets en verwerkingswerkzaamheden over meerdere systemen moeten worden verdeeld.

Hadoop en databases kunnen daardoor ook naast elkaar binnen een software- of dataomgeving worden gebruikt.

Waarom wordt Hadoop gebruikt voor big data?

Data verwerken wanneer volumes blijven groeien

Bij grote hoeveelheden data kan verwerking op één systeem steeds zwaarder worden. Hadoop maakt het mogelijk om opslag en verwerking over meerdere systemen binnen een cluster te verdelen. Daardoor is de technologie geschikt voor toepassingen waarin grote datasets periodiek of op grote schaal moeten worden verwerkt.

De capaciteit van een Hadoop-omgeving kan worden uitgebreid door extra systemen aan het cluster toe te voegen. Hierdoor kan Hadoop meegroeien met toenemende hoeveelheden data en verwerkingswerkzaamheden.

Verschil ERP en CRM

Hadoop gebruiken binnen maatwerksoftware?

Technische ontwikkeling rond data en software

Wanneer grote hoeveelheden data onderdeel zijn van een softwaretoepassing, kan een technologie zoals Hadoop onderdeel worden van de technische oplossing. De keuze daarvoor is afhankelijk van de functionele en technische eisen, de hoeveelheid gegevens en de omgeving waarin de software moet functioneren.

APPelit verzorgt de technische realisatie van maatwerksoftware en data-intensieve toepassingen op basis van de afgesproken functionaliteiten en beschikbare input van de opdrachtgever.

Daarbij kunnen onder andere softwarecomponenten worden ontwikkeld voor het verwerken, ontsluiten en gebruiken van gegevens binnen applicaties. Wanneer Hadoop onderdeel is van de afgesproken technische oplossing, kan deze technologie binnen de softwareontwikkeling worden toegepast.

Wilt u software laten ontwikkelen waarin grote hoeveelheden data moeten worden verwerkt? Neem contact op met APPelit om de technische mogelijkheden voor uw toepassing te bespreken.

Ervaar het gemak van onze service!

Wilt u dat wij contact opnemen? Vul het formulier hieronder in en we bellen u terug.
U kunt ook meer informatie achterlaten via onze contactpagina of het offerteformulier

Terugbelverzoek persoon voor APPelit

Ervaar het gemak van onze service!

Wilt u dat wij contact opnemen? Vul het formulier hieronder in en we bellen u terug.
U kunt ook meer informatie achterlaten via onze contactpagina of het offerteformulier



    Perfect en professioneel IT bedrijf, kent de markt zo goed dat ze voorlopen op de actuele ontwikkelingen.
    gertjan baan
    7 maanden geleden
    Snelle, vriendelijke en behulpzame service!
    Mika Lieve
    9 maanden geleden
    Goede en snelle service
    Hidde van den berg
    12 maanden geleden
    Ik loop momenteel stage en werk mee aan de implementatie van een e-learning platform. In dit traject heeft APPelit ons ontzettend goed geholpen om helder te krijgen waar onze behoeften en prioriteiten lagen. Ze stelden de juiste vragen en dachten professioneel en eerlijk met ons mee. Tijdens dit proces werd duidelijk dat onze uiteindelijke keuze buiten de offerte van APPelit viel. Toch bleven zij open, oprecht en behulpzaam. Ze gaven eerlijk aan wat zij konden bieden en waar de match misschien minder goed was, zonder ons iets op te dringen. Die transparante houding waarderen wij enorm. Het getuigt van integriteit en oprechte betrokkenheid bij de klant, ook als daar geen directe samenwerking uit voortkomt.
    Eddu Scholten (EDD)
    1 jaar geleden
    Goede en snelle service! Persoonlijk contact met Johannes is altijd zeer fijn.
    Cindy Van Zalen
    2 jaar geleden
    Twan van Stralen
    12 maanden geleden
    Sluiten