CrowdStrike-beveiligingsupdate veroorzaakt massale storing in Windows

Nog maar gisteren leek het idee dat één IT-fout bedrijven in hele sectoren lam zou kunnen leggen een enorme overdrijving. De recente storing bij Microsoft is echter een duidelijke herinnering aan hoe met elkaar verbonden onze wereld is. Op 19 juli 2024 veroorzaakte een defecte beveiligingsupdate van CrowdStrike wereldwijd grote problemen met Microsoft Windows-systemen. Hoe kon zo’n IT-ramp zich ontvouwen? Laten we er dieper op ingaan en de oorzaken onderzoeken.

Wat is er gebeurd?

Veel grote bedrijven, zoals JP Morgan Chase, Walmart en Shell, gebruiken Falcon, de cybersecuritysoftware van CrowdStrike, om hun IT-infrastructuur te beschermen tegen datalekken. Sterker nog, het wordt gebruikt door 82 procent van de Amerikaanse deelstaatregeringen en 48 procent van de grootste Amerikaanse steden.

In tegenstelling tot traditionele beveiligingssystemen die zware hardware en constante updates vereisen, werkt CrowdStrike Falcon volledig in de cloud. Het werkt via een agent die is geïnstalleerd op gebruikersapparaten, of het nu Windows, Mac of Linux is. Eenmaal geïnstalleerd, maakt dit programma naadloos verbinding met het cloudplatform van CrowdStrike.

De nieuwste software-update van CrowdStrike voor Windows-gebruikers bleek dus defect, wat leidde tot een Blue Screen of Death (BSOD) bij het opstarten. U hebt het systeem nodig om op te starten om die update te kunnen terugdraaien, wat een doodlopende situatie is voor een niet-technische gebruiker.

Tot overmaat van ramp trof een storing eerder op de donderdag de Microsoft Azure-services en de Microsoft 365-suite van apps in het midden van de VS. Hoewel een woordvoerder van het bedrijf verduidelijkte dat dit aparte problemen waren (het ene trof Azure, het andere CrowdStrike), bood cybersecurityconsultant Thomas Parenty (een voormalig analist van de National Security Agency) een ander perspectief. Hij suggereert een mogelijke link: “De systemen die nodig zijn voor de verbinding met Azure zouden aanvankelijk getroffen kunnen zijn door het CrowdStrike-probleem, waardoor de service onbeschikbaar werd.”

Praat eens over een chaotisch einde van de week!

Wat zijn de gevolgen?

De wijdverspreide impact van dit incident is verbluffend, gezien de CrowdStrike-agent is geïnstalleerd op miljoenen apparaten – van servers en persoonlijke computers tot zelfs internetverbonden apparaten (IoT). De update, bedoeld om de systeembewaking te verbeteren, veroorzaakte ironisch genoeg wijdverspreide storingen in verschillende sectoren, waaronder:

  • Vervoer: Luchthavens over de hele wereld hadden te maken met vertragingen en annuleringen van vluchten doordat kritieke systemen niet functioneerden.
  • Gezondheidszorg: Afsprakensystemen en toegang tot patiëntendossiers werden gehinderd in ziekenhuizen en klinieken.
  • Financiën: Banken en andere financiële instellingen ondervonden technische problemen.
  • Media: Televisiestations, zoals Sky News, werden tijdelijk uit de lucht gehaald.

Waarom gebeurde dit?

Ten eerste implementeren de meeste organisaties software-updates automatisch, waardoor de foute update zich als een lopend vuurtje verspreidde. Ten tweede was de oorzaak een slecht geschreven code – een fout waarvoor CrowdStrike sindsdien de volledige verantwoordelijkheid heeft genomen. Hoewel de exacte details van deze blunder onduidelijk blijven, is één ding zeker: grondige softwaretests hadden deze IT-ramp volledig kunnen voorkomen, of in ieder geval de impact aanzienlijk kunnen verminderen.

Waarom de update problemen kan hebben veroorzaakt:

  • Onvoldoende testen: Het QA-proces van CrowdStrike voor de update is mogelijk niet grondig genoeg geweest. Software die zo cruciaal is als Falcon zou getest moeten worden op tientallen apparaten en honderden verschillende omgevingen.
  • Beperkingen van de testomgeving: De testomgeving van CrowdStrike heeft de real-world omstandigheden mogelijk niet perfect nagebootst. Dit kan ertoe leiden dat problemen pas optreden wanneer de update interactie heeft met andere software op de machines van gebruikers.
  • Regressietesten over het hoofd gezien: Het is mogelijk dat regressietesten, die ervoor zorgen dat nieuwe updates bestaande functionaliteiten niet verstoren, niet correct zijn uitgevoerd. Dit zou kunnen verklaren waarom een beveiligingsupdate systeemcrashes veroorzaakte.
  • Menselijke factor: We zijn tenslotte maar mensen. En het is een algemeen aanvaard IT-principe om niets op vrijdagen te publiceren. Misschien was het een tijdgevoelige update, en maken mensen de domste fouten wanneer ze onder druk staan.

Wat kunnen Windows-gebruikers doen?

Het goede nieuws is dat CrowdStrike-engineers een oplossing hebben gedeeld. Hier is deze:

  1. Start Windows op in Veilige modus of de Windows Herstelomgeving
  2. Navigeer naar de map C:WindowsSystem32driversCrowdStrike
  3. Zoek het bestand dat overeenkomt met “C-00000291*.sys” en verwijder het.
  4. Start de host normaal op.

Het slechte nieuws is dat het niet voor iedereen werkt. Ten eerste, als u geen techneut bent, begrijpt u de helft van wat hier staat niet. Ook kan deze handmatige oplossing niet op afstand of voor cloudgebaseerde systemen worden toegepast, en vereist fysieke toegang tot elk getroffen apparaat. Helaas betekent dit een langdurig herstelproces voor systeembeheerders.

Voorkomen is beter dan genezen

Dus, welke lessen kunnen we trekken uit een van de meest wijdverbreide technische storingen? Voorkomen is altijd beter dan genezen. Hoewel een gedetailleerd plan voor incidentrespons goed is, is een doorlopend en goed ingeburgerd proces voor kwaliteitsborging nog beter.

Voorkom foutieve updates met deze testtypes:

  1. Unit Testing: Hierbij worden individuele componenten van de update geïsoleerd getest. Dit had problemen in de updatecode zelf kunnen identificeren voordat deze interactie had met andere software.
  2. Functioneel Testen: Dit controleert of de update de beoogde functionaliteit levert zonder onbedoelde gevolgen te veroorzaken. Dit had het testen van de update op verschillende Windows-configuraties en met verschillende softwarecombinaties kunnen omvatten.
  3. Integratietesten: Dit richt zich op hoe de update interactie heeft met andere software op een systeem. Dit had compatibiliteitsproblemen met specifieke Windows-versies of drivers kunnen onthullen.
  4. Regressietesten: Dit zorgt ervoor dat de update geen nieuwe kwetsbaarheden of crashes introduceert.

Versterk uw infrastructuur en processen:

  • Canary Releases: Implementeer nieuwe updates eerst bij een kleine groep gebruikers om kritieke problemen te identificeren voordat ze volledig worden uitgerold.
  • Feature Flags: Isoleer nieuwe functies achter feature flags om indien nodig snel terug te kunnen rollen.
  • Immutable Infrastructure: Gebruik een onveranderlijke infrastructuur om het risico op configuratie-drift te verminderen en het terugdraaien te vergemakkelijken.
  • Chaos Engineering: Introduceer opzettelijk storingen in het systeem om kwetsbaarheden te identificeren en de veerkracht te verbeteren.
  • Post-Mortem Analyse: Voer gedetailleerde post-mortem analyses uit na incidenten om de grondoorzaken te identificeren en preventieve maatregelen te implementeren.

Verbeter communicatie en samenwerking:

  • Incident Response Playbook: Creëer een gedetailleerd incident response playbook dat rollen, verantwoordelijkheden en procedures voor het omgaan met storingen schetst.
  • Cross-Functionele Teams: Stimuleer samenwerking tussen ontwikkel-, QA-, operations- en beveiligingsteams om een holistische aanpak van softwareontwikkeling te waarborgen.
  • Regelmatige Beveiligingsaudits: Voer regelmatig beveiligingsaudits uit om kwetsbaarheden te identificeren en aan te pakken.

Voelt u zich overweldigd door de complexiteit van softwaretesten? Bij QAwerk bieden we een uitgebreide reeks QA-diensten om u te helpen bij het leveren van hoogwaardige, betrouwbare software-updates. Daarnaast maken we gebruik van geavanceerde automatiseringshulpmiddelen om het testproces te stroomlijnen en het identificeren van problemen te versnellen. Neem vandaag nog contact met ons op om te ontdekken hoe onze expertise u kan helpen om vertrouwen op te bouwen in uw software.