Understrukna ord finns i lektionsordlistan. Tryck på ett ord för att se alla översättningar. Lägg till eller redigera ord i messages/glossary.json (alla språknycklar du lägger till visas i rutan).
Infrastructure, DevOps, and support
Monitoring and incident response
Ett larm gick precis i PagerDuty, vi måste kolla upp det omedelbart.
Vi ser en enorm spik i CPU-användningen på våra primära databasservrar.
Jag kollar just nu igenom felloggarna i Datadog för att försöka förstå vad som händer.
Användarna på X klagar på att sidan ligger nere, vi har en pågående P1-incident.
Vi måste sätta upp ett war-room i Slack för att koordinera incidenthanteringen.
Vem är 'incident commander' för det här specifika avbrottet just nu?
Vi har extremt många 500-fel (Internal Server Error) som rullar in i loggarna.
Det verkar vara minnet som tar slut, tjänsten startar om sig själv hela tiden.
Jag bekräftar att jag har mottagit larmet och börjat felsöka problemet.
Vi bör skriva en statusuppdatering på vår publika statussida för att informera kunderna.
Incidenten är nu löst och systemet återhämtar sig, svarstiderna är tillbaka på normal nivå.
Vi måste absolut skriva en ordentlig post-mortem för att undvika att det här händer igen.
Låt oss analysera 'root cause' (grundorsaken) på mötet i eftermiddag.
Jag konfigurerar ett nytt larm som varnar oss ifall hårddisken blir över nittio procent full.
Vi hade nio minuters obekräftad nertid (downtime) under natten.
Grafana-dashboardsen visar en tydlig nedgång i antalet lyckade transaktioner.
Vi måste förbättra vår övervakning av betalflödet, vi borde ha upptäckt det här tidigare.
Det var ett extremt svårt fel att hitta, det fanns ingenting alls i serverloggarna.
Jag sänker allvaret på incidenten från P1 till P3 eftersom kärnsystemet nu fungerar.
Vi saknar centraliserad loggning för just den där gamla mikrotjänsten.
Incidentrapporten är färdigskriven och ligger nu upplagd på intranätet för granskning.
Vi kör en uppföljning imorgon för att se till att de förebyggande åtgärderna implementeras.
Systemet timeade ut efter trettio sekunder, vilket skapade en enorm flaskhals.
Larmet var bara ett falsklarm, men vi bör justera tröskelvärdet för att undvika brus.
Vårt externa övervakningsverktyg (Pingdom) rapporterar att sajten svarar otroligt långsamt.
Klockan tre i natt tappade vi plötsligt anslutningen till vår kortinlösen-partner.
Jag skapar en detaljerad tidslinje över exakt vad som skedde under driftstörningen.
Vårt främsta mål just nu är att stoppa blödningen, därefter fokuserar vi på rotorsaken.
Vi måste se över våra on-call-scheman (jour) eftersom larmet missades inledningsvis.
Den här grafen visar i realtid exakt hur mycket trafik vi tar emot just nu.
Jag upptäckte felet av en slump när jag övervakade systemet manuellt imorse.
Vi har implementerat spårning (tracing) så vi kan följa anropen genom hela nätverket.
Under post-mortem-mötet är det extremt viktigt att vi har en 'blame-free' kultur.
Tjänsten var nere för våra internationella kunder, men Sverige-trafiken fungerade konstigt nog.
Det visar sig att felet berodde på ett utgånget SSL-certifikat som ingen hade övervakat.
Driftstörningen orsakades tyvärr av ett manuellt nätverksfel hos vår internetleverantör.
Jag har lagt in varningar som triggas om den asynkrona kön plötsligt blir för lång.
Vi skickar alla våra systemloggar direkt in i Elasticsearch för snabb sökbarhet.
Kan du ta fram all historisk data för den här specifika noden från de senaste dygnet?
Jag tror vi har listat ut mönstret, systemet kraschar alltid precis efter midnatt.
Vi behöver fler mätvärden (metrics) från frontend-applikationen för att förstå kundens upplevelse.
Den automatiska återhämtningen (auto-healing) fungerade exakt som den skulle, vilket är skönt.
Vårt larm för inaktivitet löste ut eftersom inga filer laddades upp under en timme.
Jag sätter PagerDuty på paus under de kommande tio minuterna medan jag rullar tillbaka koden.
Incidenten eskalerades till tredje linjens support eftersom felet låg extremt djupt i koden.
Det var ett fantastiskt bra lagarbete under nattens stressiga incidenthantering, bra jobbat alla!
Det preventiva arbetet vi gjorde förra månaden räddade oss från ett totalt sammanbrott idag.
Nu när faran är över, låt oss se till att kundtjänst har all information de behöver för att svara kunderna.
Vi ska integrera vår övervakning mycket tajtare med Slack för att korta ner reaktionstiden.
Ett väl fungerande övervakningssystem är absolut kritiskt för att vi ska kunna sova gott om nätterna.