VMware sendt helt til tælling i skyen

Lige da VMware var ved at komme sig efter et ubetydeligt strømforsyningsproblem, slog den menneskelige faktor til, og så gik det helt galt.

Artikel top billede

Foto: Philippe Ramakers

Læs også:

Cloud computing: Sådan fungerer det

Det er ikke nemt at samle en distribueret it-arkitektur i skyen. Jo flere ressourcer man prøver at samle, jo mere kan gå galt. Og nej, det her handler ikke om Amazon's nylige problemer.

Denne gang gik det ud over VMware, som for nylig har lanceret en betaversion af, hvad firmaet kalder branchens første "åbne platform as a service", som er en slags hosting-service for udviklere.

Den 25. april klokken 06.11 fik tjenesten ifølge InformationWeek et mindre problem med en strømforsyning i et storage-kabinet, som gav huller i driften. I forsøget på at reparere det problem, gik siden helt i sort, og den nedtur varede til godt hen på næste dag.

Hændelsen bliver beskrevet af blogger og Cloud Foundry-administrator Dekel Tankel.

Problemet med strømforsyningen betød, at brugerne ikke kunne få adgang til en "logical unit number (LUN)", eller identifikator af en disk eller et sæt af diske i Cloud Foundry.

Et ventet problem

En fejl i strømforsyningen er ikke en uventet begivenhed. Den slags sker, og det er skyer designet til at opdage og overleve. Enten ved at hente strøm fra en anden kilde eller ved at route sig rundt om problemet og bruge en back up.

I dette tilfælde, skriver Tankel, "var vores software, vores overvågningssystem og vores praktiske procedurer ikke synkroniseret."

Konsekvensen var, at det lille ubetydelige problem blev større og bredte sig som ringe i vandet og ramte The Cloud Controller. Se her hvordan CloudFoundry rent faktisk virker.

Da tjenesten var kommet til hægterne igen, og administratorerne fandt ud af, at der slet ikke var mistet data, skete der følgende:

Cloud-teamet fortsatte uforvarende med at forværre fejlen. De ville lære af hændelsen, så driftsteknikerne gik omgående i gang med at registrere, hvad der gik galt og nedfælde en manual for de korrekte procedurer for at undgå en lignende hændelse i fremtiden.

"Planen var, at det skulle være en på-papir-kun-øvelse, indtil manualen blev evalueret," skriver Tankel.

Mere skulle der ikke til

Uheldigvis skete der det, at en af driftsfolkene med manualen kom til at røre tastaturet, og resultatet var, at hele netværksinfrastrukturen foran Cloud Foundry, gik ned. Mere skulle der ikke til.

Tre dage senere skrev Tankel på sin blog:

"This took out all load balancers, routers, and firewalls; caused a partial outage of portions of our internal DNS infrastructure; and resulted in a complete external loss of connectivity to Cloud Foundry through the next 13 hours, until service was restored at 11:30 a.m. April 26."

VMware's uheld er anderledes end det omfattende nedbrud, Amazon var ude for den 21. april, men der er ikke desto mindre uheldsvarslende lighedspunkter, når det gælder den menneskeligte faktor.

Læs hele den detaljerede beretning på InformationWeeks hjemmeside.

Læses lige nu
    Computerworld Events

    Vi samler hvert år mere end 6.000 deltagere på mere end 70 events for it-professionelle.

    Ekspertindsigt – Lyt til førende specialister og virksomheder, der deler viden om den nyeste teknologi og de bedste løsninger.
    Netværk – Mød beslutningstagere, kolleger og samarbejdspartnere på tværs af brancher.
    Praktisk viden – Få konkrete cases, værktøjer og inspiration, som du kan tage direkte med hjem i organisationen.
    Aktuelle tendenser – Bliv opdateret på de vigtigste dagsordener inden for cloud, sikkerhed, data, AI og digital forretning.

    Digital transformation | Ballerup

    Computerworld Cloud & AI Festival 2026

    Eksplosiv udvikling i cloud og AI kræver overblik og viden. Computerworld samler 3.000 it-professionelle, 70+ leverandører og 120+ talere om AI, infrastruktur, data, compliance og sikkerhed. To dage med viden og netværk. Tilmeld dig nu.

    Digital transformation | Frederiksberg

    Roundtable: AI i drift – fra eksperimenter til ansvar, værdi og kontrol

    AI-initiativerne breder sig hurtigt, men skaleringen halter. Kun hver fjerde virksomhed har flyttet en større del af sine AI-eksperimenter i produktion. Computerworld samler en udvalgt kreds af CIO’er og digitale beslutningstagere til et...

    Annonce

    Navnenyt fra it-Danmark

    Norriq Danmark A/S har pr. 2. marts 2026 ansat Kristoffer Hyltoft Overlund som Consultant ERP. Han skal især beskæftige sig med understøtte vores kunders forretning og vækstambitioner. Han kommer fra en stilling som Salgskonsulent hos D´Wine. Han er uddannet hos Aalborg Universitet hvor hvor han har taget en cand.it, IT-ledelse. Nyt job

    Kristoffer Hyltoft Overlund

    Norriq Danmark A/S

    Netip A/S har pr. 1. august 2026 ansat Thomas B. Steffensen som Seniorkonsulent ved netIP's kontor i Thisted. Han kommer fra en stilling som Senior IT/OT Network Consultant hos Frontmatec. Nyt job
    Norriq Danmark A/S har pr. 1. januar 2026 ansat Allan Kimmer Jensen som Lead Solution Architect. Han skal især beskæftige sig med at sikre vores kunder får en verdensklasse brugeroplevelse gennem stærk frontend-arkitektur og kodekvalitet. Han kommer fra en stilling som Freelance Consultant hos Remmik. Han er uddannet hos Center for Medie og Kommunikation, Roskilde. Nyt job

    Allan Kimmer Jensen

    Norriq Danmark A/S

    Norriq Danmark A/S har pr. 3. august 2026 ansat Jeppe Lindberg som Developer. Han skal især beskæftige sig med at være med til at analysere, designe og udvikle skræddersyede forretningsløsninger til vores kunder i Business Central. Han kommer fra en stilling som Business Central Developer hos Evexo. Han er uddannet hos Aalborg Universitet- Master's degree, Computer Software Engineering. Nyt job

    Jeppe Lindberg

    Norriq Danmark A/S