# Runbook: KFZ-Rechner, hohe Fehlerrate **Alarm:** HoheFehlerrate **Schweregrad:** Sev 2 (Sev 1, wenn über 50 % und länger als 15 Minuten) **Zuständig:** Team Bestandssysteme ## 1. Lage feststellen curl -s https://kfz.intern/health journalctl --user -u kfz-rechner.service --since "15 min ago" | tail -50 podman inspect kfz-rechner --format '{{.ImageName}}' Grafana-Dashboard: https://grafana.intern/d/kfz ## 2. Häufigste Ursachen, nach Wahrscheinlichkeit | Beobachtung im Log | Ursache | Maßnahme | |-------------------------------|------------------------|-------------------| | `connection refused` zur DB | Datenbank nicht da | Abschnitt 3.1 | | `ValueError` gehäuft | fehlerhaftes Deployment| Abschnitt 3.2 | | `pool exhausted` | Verbindungen erschöpft | Abschnitt 3.3 | | keine Auffälligkeit | vorgelagertes System | Abschnitt 3.4 | ## 3. Maßnahmen ### 3.1 Datenbank nicht erreichbar systemctl status postgresql # auf db-prod01 Ist die DB tatsächlich aus: Eskalation an Team Datenbanken, Sev 1. ### 3.2 Fehlerhaftes Deployment Rollback (Dauer etwa 30 Sekunden): cd ~/kfz-betrieb && git revert HEAD && git push Der GitOps-Abgleich zieht binnen zwei Minuten nach. Beschleunigen: `systemctl --user start gitops-abgleich.service` ### 3.3 Verbindungspool erschöpft systemctl --user restart kfz-rechner.service Tritt das mehr als einmal pro Woche auf: Ticket für Poolgröße anlegen. ### 3.4 Keine Auffälligkeit Vorgelagerten Dienst prüfen, dann Eskalation an den Incident Commander. ## 4. Eskalation - Rufbereitschaft Bestandssysteme: siehe Dienstplan - Team Datenbanken: siehe Dienstplan - Ab Sev 1: Leitung Anwendungsbetrieb informieren ## 5. Nach der Störung Postmortem anlegen, wenn die Störung länger als 30 Minuten dauerte oder Kunden betroffen waren.