Konfigurationsfejl skyld i stort Microsoft-nedbrud

Se hvorfor Microsofts store Azure-tjeneste bragede ned i sidste uge.

Artikel top billede

Computerworld News Service: Det var en fejl i systemkonfigurationen, der var årsag til det nedbrud, der ramte vesteuropæiske Windows Azure-kunder i sidste uge, oplyser Microsoft.

På grund af denne fejl var Microsofts platform til hosting og udvikling af offentlige cloud-applikationer utilgængelig i cirka to en halv time torsdag.

Microsoft har ikke sat tal på, hvor mange kunder, der fik nedbruddet at føle.

Problemet havde at gøre med en "sikkerhedsventil" i Azures netværksinfrastruktur, der har til formål at forhindre netværksnedbrud i at sprede sig ude af kontrol.

Ny kapacitet

For at bremse en kaskadevirkning begrænser denne mekanisme antallet af forbindelser, som kan oprettes til netværkshardwareenheder.

"Forud for denne hændelse tilføjede vi ny kapacitet til den vesteuropæiske underregion på grund af øget efterspørgsel. Begrænsningen af antallet af enheder var dog ikke blevet justeret under valideringsprocessen til at modsvare den nye kapacitet," skriver Mike Neil, der er chef for Windows Azure, i et blogindlæg.

En pludselig stigning i brugen af den påvirkede klynge førte til, at sikkerhedsventilens tærskel blev overskredet, hvilket genererede en storm af advarselsbeskeder i netværksadministrationen.

"Den øgede administrationstrafik udløste fejl i nogle af klyngens hardwareenheder, hvilket fik deres CPU'ers udnyttelsesgrad op på 100 procent, hvilket påvirkede datatrafikken," forklarer Neil.

Sådan løste Microsoft problemet

Microsoft løste hurtigt problemet ved at øge grænseværdierne for den påvirkede klynges sikkerhedsventil.

For at forhindre situationen i at gentage sig er Microsoft nu ved at rette de identificerede fejl i netværkshardwareenhederne og arbejder desuden på at forbedre systemerne til netværksovervågning, så de kan opdage og løse sådanne problemer, før de fører til nedbrud.

Analytiker James Staten fra Forrester Research påpeger, at PaaS-clouds (platform as a service) såsom Azure er meget komplekse og stærkt automatiserede miljøer, og understreger, at der kan opstå tekniske problemer i produktionsmiljøer, som ikke kan forudses i et testmiljø.

"Dette ser ud til at være et sådant tilfælde," vurderer han.

I takt med at der tilføjes nye funktioner, anvendelsen øges og andre faktorer træder i kraft, er administratorerne nødt til at sørge for at justere og optimere det kørende system, og nogen gange vil noget gå i stykker, siger han.

Ingen grund til bekymring

"Bør det bekymre klienterne? Faktisk ikke. Dette er et eksempel på, hvad der kan ske i et cloud-miljø. Men i et typisk datacenter sker der oftere langt værre ting," fremhæver Staten.

It-chefer og udviklere med planer om at hoste applikationer i skyen bør designe og konfigurere dem til at være fejltolerante. "Det er en grundlæggende ændring i tilgangen, som udviklere og driftsteam er nødt til at forstå, når de kaster sig over cloud-udrulning," siger han.

"Disse former for nedbrud udgør læringsmuligheder både for cloud-leverandørerne og for cloud-kunderne. I stedet for at se en sådan hændelse som et argument imod cloud bør man se den som en mulighed for at forbedre sin viden om cloud," tilføjer han.

Oversat af Thomas Bøndergaard

Læses lige nu

    Navnenyt fra it-Danmark

    Netip A/S har pr. 19. august 2025 ansat Dennis Kobberø Nagy som Datateknikerelev ved netIP's kontor i Herning. Han har tidligere beskæftiget sig med flere andre fagområder - bla. har han været forsikringsrådgiver og rekrutteringskonsulent. Nyt job
    Norriq Danmark A/S har pr. 1. september 2025 ansat Hans Christian Thisen som AI Consultant. Han skal især beskæftige sig med at bidrage til udvikling og implementering af AI- og automatiseringsløsninger. Nyt job

    Hans Christian Thisen

    Norriq Danmark A/S

    Netip A/S har pr. 15. september 2025 ansat Jimmi Overgaard som Key Account Manager ved netIP's kontor i Viborg. Han kommer fra en stilling som Sales Executive hos Globalconnect A/S. Nyt job

    Jimmi Overgaard

    Netip A/S

    Norriq Danmark A/S har pr. 1. oktober 2025 ansat Rasmus Stage Sørensen som Operations Director. Han kommer fra en stilling som Partner & Director, Delivery hos Impact Commerce. Han er uddannet kandidat it i communication and organization på Aarhus University. Han har tidligere beskæftiget sig med med at drive leveranceorganisationer. Nyt job

    Rasmus Stage Sørensen

    Norriq Danmark A/S