Verstoringsherstel: hoe systemen overeind blijven na een storing
Verstoringsherstel is het vermogen van een organisatie om na een storing, aanval of ramp haar computersystemen en gegevens weer snel en betrouwbaar aan de praat te krijgen. Denk aan een ziekenhuis waarvan het elektronisch patiëntendossier plotseling onbereikbaar is door een stroomstoring, of een bank die te maken krijgt met een gijzelsoftware-aanval (ransomware) die alle bestanden versleutelt. Verstoringsherstel is het geheel van techniek, procedures en planning waarmee zulke organisaties binnen een vooraf afgesproken tijd weer operationeel zijn, zonder onherstelbaar gegevensverlies.
Een goede vergelijking is een reserveband in de auto. Je hoopt hem nooit nodig te hebben, maar als een band klapt op de snelweg, wil je niet pas dan gaan uitzoeken hoe je hem wisselt. In de IT-wereld betekent dat: vooraf kopieën maken van data (back-ups), uitwijksystemen klaarzetten, en regelmatig oefenen of de noodprocedure ook echt werkt. Organisaties die dit goed op orde hebben, merken van een storing soms weinig meer dan een korte onderbreking; organisaties die het niet op orde hebben, kunnen dagen- of wekenlang stilliggen.
Wat is het precies?
Verstoringsherstel (in het Engels disaster recovery, vaak afgekort tot DR) draait om twee centrale meetwaarden. De eerste is de Recovery Time Objective (RTO): hoe lang mag het maximaal duren voordat een systeem weer werkt? Voor een webshop kan dat een paar minuten zijn, voor een intern archiefsysteem misschien een dag. De tweede is de Recovery Point Objective (RPO): hoeveel gegevensverlies is acceptabel, uitgedrukt in tijd? Een RPO van één uur betekent dat je bij herstel hooguit het laatste uur aan mutaties kwijt mag raken.
Om deze doelen te halen, bouwen organisaties meerdere lagen van bescherming. De basis is de back-up: een kopie van data die apart wordt bewaard, vaak volgens de zogeheten 3-2-1-regel (drie kopieën, op twee verschillende soorten media, waarvan één buiten de deur). Voor systemen die geen moment uit mogen vallen, gaat men een stap verder met redundantie: dezelfde dienst draait op meerdere, fysiek gescheiden locaties tegelijk. Valt de ene locatie uit, dan neemt de andere automatisch over. Dat heet failover.
Veel organisaties werken met uitwijklocaties die worden ingedeeld naar paraatheid: een hot site draait continu mee en kan binnen seconden overnemen, een warm site staat klaar maar moet nog worden opgestart, en een cold site is enkel beschikbare hardware zonder actuele data, die pas bij een echte ramp wordt ingericht. De opkomst van clouddiensten zoals Amazon Web Services, Microsoft Azure en Google Cloud heeft dit sterk veranderd: in plaats van een eigen fysieke uitwijklocatie te bouwen, kunnen bedrijven tegenwoordig met een paar instellingen hun systemen automatisch laten uitwijken naar een ander datacenter, vaak in een andere regio of zelfs ander land.
Een laatste, steeds belangrijker onderdeel is bescherming tegen gijzelsoftware. Klassieke back-ups bleken kwetsbaar: als een aanvaller ook de back-upserver bereikt, worden die kopieën eveneens versleuteld of gewist. Daarom werken veel systemen nu met onveranderbare (immutable) back-ups: kopieën die na het maken technisch niet meer aangepast of verwijderd kunnen worden, zelfs niet door een beheerder met de juiste wachtwoorden.
Wat wil men ermee bereiken?
Het kerndoel is continuïteit van dienstverlening: zorgen dat een storing niet uitgroeit tot een crisis. Voor bedrijven gaat dit direct over geld. Elke minuut dat een webshop, betaalsysteem of productielijn stilligt, kost omzet en reputatie. Onderzoeken van IT-marktpartijen als Gartner en IBM wijzen al jaren op gemiddelde kosten van duizenden tot tienduizenden euro's per uur downtime bij middelgrote tot grote organisaties, afhankelijk van de sector.
Daarnaast speelt wetgeving een steeds grotere rol. In de Europese Unie moeten banken en andere financiële instellingen sinds januari 2025 voldoen aan de DORA-verordening (Digital Operational Resilience Act), die expliciet eist dat zij hun herstelvermogen testen en documenteren. Voor bredere sectoren zoals energie, zorg en digitale infrastructuur geldt de NIS2-richtlijn, die eveneens eisen stelt aan het beperken en herstellen van verstoringen. Organisaties die hier niet aan voldoen, riskeren boetes en aansprakelijkheid.
Een derde drijfveer is vertrouwen. Klanten, patiënten en burgers verwachten dat hun gegevens niet alleen veilig zijn, maar ook beschikbaar blijven. Verstoringsherstel is dus niet alleen een technisch vraagstuk, maar ook een kwestie van maatschappelijk vertrouwen in digitale dienstverlening.
Voorbeelden uit de praktijk
Het containerbedrijf Maersk werd in 2017 getroffen door de NotPetya-malware, die binnen enkele uren duizenden servers en laptops wereldwijd onbruikbaar maakte. Het bedrijf kon zijn centrale systemen herstellen dankzij één toevallig uitgeschakelde domeincontroller in een kantoor in Ghana, die buiten het getroffen netwerk had gestaan. De schade werd destijds geschat op 250 tot 300 miljoen dollar, en het incident geldt sindsdien als schoolvoorbeeld van hoe kwetsbaar centraal beheerde IT kan zijn zonder goed geïsoleerde back-ups.
British Airways kreeg in mei 2017 te maken met een stroomstoring in een datacenter nabij Heathrow die, door een storing in de uitwijkprocedure, uitgroeide tot een wereldwijde uitval van boekings- en incheck-systemen. Duizenden vluchten werden geannuleerd; de geschatte schade liep op tot ruim 100 miljoen pond. De zaak liet zien dat redundante hardware alleen niet voldoende is als de overschakelprocedure zelf niet goed werkt.
In Nederland kreeg de Universiteit Maastricht eind 2019 te maken met een ransomware-aanval die vrijwel het hele onderzoeks- en onderwijsnetwerk platlegde. De universiteit besloot destijds, na een intern ethisch debat, losgeld te betalen omdat herstel vanuit back-ups niet volledig mogelijk bleek; het incident versnelde in Nederland de discussie over onveranderbare back-ups en gescheiden noodnetwerken.
Clouddiensten als AWS en Azure bieden tegenwoordig kant-en-klare disaster-recoverydiensten, zoals AWS Elastic Disaster Recovery, waarmee bedrijven hun servers continu laten spiegelen naar een andere regio en bij uitval binnen minuten kunnen omschakelen. Grote banken en verzekeraars maken hier in toenemende mate gebruik van, mede door de DORA-verplichtingen.
Hoe ver is de techniek?
Verstoringsherstel is een volwassen vakgebied: de basisprincipes (back-ups, redundantie, uitwijklocaties) bestaan al decennia en worden breed toegepast. Wat de laatste tien jaar sterk is veranderd, is de toegankelijkheid. Waar een eigen uitwijkdatacenter vroeger alleen was weggelegd voor grote organisaties met flinke budgetten, kunnen dankzij cloud computing ook kleinere bedrijven tegenwoordig geautomatiseerde faalveilige systemen inrichten tegen relatief lage kosten.
Tegelijkertijd blijft de praktijk achter bij de belofte. Onderzoeken van beveiligingsbedrijven zoals Veeam laten jaar na jaar zien dat een aanzienlijk deel van de organisaties hun herstelplan niet regelmatig test, of dat geteste herstelprocedures in de praktijk toch langer duren dan gepland. Ransomware blijft de grootste uitdaging: aanvallers richten zich inmiddels bewust op back-upsystemen, waardoor technieken als immutable storage en strikt gescheiden (air-gapped) netwerken steeds gangbaarder worden, maar nog niet overal zijn ingevoerd.
Een opkomende ontwikkeling is het gebruik van kunstmatige intelligentie om afwijkingen vroegtijdig te signaleren en herstelprocessen deels te automatiseren, bijvoorbeeld door verdacht gedrag op een back-upserver te herkennen voordat gegevens worden aangetast. Deze toepassingen zijn nog relatief jong en worden vooral door grote cloud- en beveiligingsleveranciers ontwikkeld; onafhankelijk bewijs over hoe effectief ze in de praktijk zijn, is nog beperkt.
Wie werken eraan?
De grote cloudleveranciers Amazon (AWS), Microsoft (Azure) en Google Cloud bieden geïntegreerde disaster-recoverydiensten aan en investeren fors in wereldwijde datacenterinfrastructuur die hiervoor nodig is. Gespecialiseerde softwareleveranciers zoals Veeam, Zerto (onderdeel van Hewlett Packard Enterprise) en Commvault richten zich specifiek op back-up- en hersteltechnologie voor bedrijven die niet volledig in de cloud werken.
Op het gebied van normen en richtlijnen speelt het Amerikaanse NIST (National Institute of Standards and Technology) een leidende rol met publicaties over contingency planning voor IT-systemen. Internationaal is er de ISO 22301-norm voor continuïteitsmanagement. In Europa houdt ENISA, het Agentschap van de Europese Unie voor cyberbeveiliging, zich bezig met richtlijnen voor digitale weerbaarheid, mede ter ondersteuning van NIS2 en DORA. In Nederland adviseert het Nationaal Cyber Security Centrum (NCSC) organisaties en vitale sectoren over herstelvermogen bij cyberincidenten.
Daarnaast zijn er brancheorganisaties zoals de internationale Disaster Recovery Institute (DRI), die opleidingen en certificeringen aanbiedt aan professionals die binnen bedrijven verantwoordelijk zijn voor het opstellen en testen van herstelplannen.