Logo GH

Schichtplanung

1) Ziele und Rahmenbedingungen

Die Schichtplanung stellt sicher, dass die Plattform kontinuierlich auf Zwischenfälle und Verkehrsspitzen vorbereitet ist, ohne dass Teams ausbrennen. Die Ziele sind:
  • Gewährleistung der Abdeckung von SLO-kritischen Prozessen (Einlagen, Raten/Settle, Schlussfolgerungen, KYC/AML);
  • Reduzierung der MTTA/MTTR zu jeder Tageszeit;
  • Einhaltung des Arbeitsrechts und der internen Richtlinien (Wochenenden/Pausen/Nächte).

2) Rollen und Unterstützungsstufen

L1 (NOC/Operations): Primärtriage, Runbook-Start, Eskalationen.
L2 (Domain On-Call): Zahlungen, Spiele/Kern, Daten/Infra - tiefe Diagnose und Fixes.
L3 (SRE/Platform/Dev): Konfigurationsänderungen, Patches, Emergency Releases.
IC/CL (Incident Commander/Comms Lead): Leitet den Vorfall und die Kommunikation.
Duty Manager (im Wechsel): bestätigt Staffing, Risiken, Freeze-Fenster.

3) Schalt- und Rotationsmodelle

3. 1 24 × 7 Abdeckung

8 × 3 (drei acht Stunden): Tag (08: 00-16: 00), Swing (16: 00-00: 00), Nacht (00: 00-08: 00). Einfach zu verwalten, erfordert mehr Mitarbeiter.
12 × 2 (zwei zwölf Stunden): Tag (08: 00-20: 00), Nacht (20: 00-08: 00). Weniger Handler, höhere Ermüdungsgefahr - mit Einschränkungen verwenden.
Follow-the-sun: EU → AMER → APAC, minimale Nacht; erfordert ein verteiltes Team.

3. 2 Rotationsmuster (Beispiel)

Panama/Pitman (2-2, 3-2, 2-3): Wechsel von 12 Stunden mit einem langen Wochenende (erfordert eine strenge Ermüdungskontrolle).
4-on/4-off (12h): 4 Tage à 12h, 4 Wochenenden; geeignet für L1 bei guter Automatisierung.
5 × 8 (klassisch): für L2/L3 + Bereitschaftsdienst in den Nächten/Wochenenden.

3. 3 On-Call-Dienste

Primär/Sekundär: Jede Domain hat einen primären und sekundären On-Call.
Shadow-on-Call: Ausbildung neuer Ingenieure unter den Fittichen von Primary.

4) Berechnung von Zustand und „Schrumpfung“ (shrinkage)

4. 1 Grundformel FTE

Erforderliche FTEs pro Rolle:

FTE = (coverage hours per week/productive FTE hours per week) × (1 + shrinkage)

Wo shrinkage umfasst Urlaub/Krankenhaus/Ausbildung/1: 1/retro/admin-Zeit (in der Regel 20-35%).

Beispiel (L1 24 × 7, 8 Stunden):
  • 168 Stunden Abdeckung/35 produktive Stunden/Woche ≈ 4. 8
  • Bei shrinkage 30% → 4. 8 × 1. 3 ≈ 6. 2 FTE (für Nachhaltigkeit auf 7 runden).

4. 2 Plan für Peaks

Fügen Sie den Peak-Faktor für Veranstaltungen (Top-Matches, Turniere) hinzu: + 10-25% FTE in den Kalenderfenstern. Verwenden Sie historische Alert/Traffic-Charts.

5) SLO-Abdeckung und Risikofenster

Richten Sie eine Matrix kritischer Stunden ein (lokale „Prime Time“ von GEO/Zahlungsmethoden).
Legen Sie eine Mindestbesetzung pro Slot fest (z. B. Night: L1 × 2, L2-Payments × 1 on-call, L2-Games × 1 on-call, IC durch Rotation).
Weisen Sie für Releases/Migrationen einen Release Guard (extra L2/SRE) für einen Zeitraum von + 60 Minuten Post-Monitoring zu.

6) Handover (Schaltgetriebe)

Struktur 10-15 Minuten:

1. Status von SLOs/Alerts und offenen Vorfällen.

2. Geplante Arbeiten im Fenster + Risiken.

3. Blocker/Erwartungen (PSP/KYC-Anbieter, Reglement).

4. Vereinbarte Komma-Pläne (Status-Seite, Partner).

5. Überprüfung der Schichtzusammensetzung und der On-Call-Kontakte.

Die Checkliste des Händlers muss im Wiki/Bot sein; Protokoll - in einem Var-Raum oder einem austauschbaren Kanal.

7) Kalender und Ersatz

Planungshorizont: 8-12 Wochen; Ersatz - spätestens 2 Wochen im Voraus (außer bei höherer Gewalt).
Freeze-Perioden: Großveranstaltungen/Feiertage - Urlaubsverbot für Schlüsselrollen (später kompensiert).
Buddy-Regel: Ersatz nur durch einen Ingenieur derselben Domäne/Qualifikation oder mit einem zusätzlichen Schatten.

8) Integration mit der Plattform

Alerting: Routing durch aktive Schicht und Domänen (P1→pager+var-Raum).
Incident-Bot: Befehle '/rota', '/whoisoncall', Auto-Erwähnungen IC/CL.
Freigaben: CAB synchronisiert mit Schichtplan; Freigaben außerhalb der Abdeckung - verboten.
Status-Seite: CL aus aktiver Schicht im Bot bestätigt.

9) Nachhaltigkeit und Teamgesundheit

Arbeitsnormen: Nacht/Wochenende - Zuschläge und Freizeit; maximale Nacht in Folge (z. B. ≤3).
Pausen: alle 2-3 Stunden eine kurze Pause; bei 12h sind zwei lange obligatorisch.
Fatigue-watch: Stunden-/Wochenbegrenzung, Regel „nicht mehr als N P1 pro Schicht für eins“.
Psychologische Unterstützung: Debrief nach schweren P1, Comp-Time.

10) Multi-Region und Follow-the-Sun

Unterteilen Sie die Marken/Tenanten nach Regionen (EU/LATAM/APAC) mit lokalen L1- und L2-Domains.
Regionale ICs eskalieren zu globalen ICs mit überregionalen Vorfällen.
Täglicher überregionaler Handover (15 Min.) mit Risiko- und Arbeitstransfer.

11) Politiker und RACI

Politik „Shift & On-Call“: Wer, wie und wann übernimmt; Ersatz; Verspätung; Reserve.
SoD/Zugänge: IC/CL/Finanztransaktionen - getrennte Rollen; JIT-Erhöhungen nur durch bot.
RACI: Jede Schicht hat IC (A), Duty Manager (A/R), L1/L2 (R), Compliance/Sec (C), Handbuch (I).

12) Tools und Daten

Ein einziger Kalender (mit den Attributen: Domäne, Region, Kontakt, Reserve).
Schaltlast Dashboards: Alerts/Stunde, Incidents/Type, Releases/Windows.
Fairness Reports (Fair-Share): Abdeckung von Nächten/Wochenenden nach Personen.
Integration mit HR/PTO, so dass shrinkage automatisch zählt.

13) Qualitätskennzahlen (KPI/KRI)

Coverage Rate:% Stunden mit voller Besetzung.
MTTA/MTTR durch Slots: Tag/Abend/Nacht.
Handover Defects: Anzahl der fehlenden Checklistenpunkte.
Pager Fatigue: Warnhinweise/Person/Woche; nächtliche Anrufe (Ziel - ↓).
SLA-Ersatz:% geschlossene Schichten durch Ersatz ≤ 48 Stunden vor Beginn.
Training Coverage: Anteil der Schichten mit Shadow Slot für neue Betreiber.
Fair-Share Index: Einheitlichkeit der Nächte/Wochenenden nach Mitarbeitern.

14) Umsetzungsfahrplan (4-8 Wochen)

Ned. 1-2: Allert-/Peak-Historie sammeln, SLO-kritische Fenster definieren; Wählen Sie ein Modell (8 × 3 oder follow-the-sun), zählen Sie FTE und shrinkage.
Ned. 3-4: Veröffentlichen Sie die Richtlinie „Shift & On-Call“, aktivieren Sie die Handover-Checkliste, führen Sie den allgemeinen Kalender und die Bot-Befehle „/whoisoncall “, „/handover“ aus.
Ned. 5-6: Eskalationen und Substitutionen debuggen, Fair-Share-Berichte hinzufügen, CAV/Releases mit Schichten synchronisieren, Freeze-Fenster eingeben.
Ned. 7-8: Retro durch Burnout und Qualität der Handler, Korrektur der Nachtzusammensetzung, Start des Schattenprogramms und IC/CL-Zertifizierung.

15) Muster und Artefakte

Shift Rota (Beispiel für EU, Kiew Zeit):
SteckplatzDie ZeitL1L2-Payments (on-call)L2-Games (on-call)ICCL
Day08:00–16:00211durch Rotationdurch Rotation
Swing16:00–00:00211durch Rotationdurch Rotation
Night00:00–08:00211durch Rotationdurch Rotation

Handover Checklist (10 Punkte): SLOs, Vorfälle, Jobs, Risiken, Freigaben, Anbieter, Zugriffe, Statusseiten, offene Tickets, Staffing.
Ersatz SOP: So ordnen Sie Ersatz, Aufnahmekriterien, Reservekontakt an.
Freeze Calendar: Veranstaltungen/Feiertage und Verbote für RTOs/Releases.

16) Antipatterns

Ein On-Call für alles ohne Domain-Trennung.
12-stündige Nächte in Folge ohne Einschränkungen und Unterbrechungen.
Freigaben in Stunden ohne IC/CL/CL-Verfügbarkeit.
Hendover „auf das gesprochene Wort“, ohne Checkliste und Eintragungen.
Ignoriere shrinkage → einen chronischen Unterkomplex.
Das Zero-Shadow-Programm → Fragilität und SPOF beim Menschen.

Summe

Schichtplanung ist eine technische Herausforderung: FTE und Shrinkage-Berechnung, ehrliche Rotation und Gesundheitsschutz, rigorose Handovers und Integration mit Alerting/ChatOps/CAB. Ein solcher Rahmen bietet eine vorhersehbare 24 × 7-SLO-Abdeckung, schnelle Reaktionen auf Vorfälle und geschäftliche Nachhaltigkeit, ohne dass Teams ausgebrannt sind.

Contact

Kontakt aufnehmen

Kontaktieren Sie uns bei Fragen oder Support.Wir helfen Ihnen jederzeit gerne!

Integration starten

Email ist erforderlich. Telegram oder WhatsApp – optional.

Ihr Name optional
Email optional
Betreff optional
Nachricht optional
Telegram optional
@
Wenn Sie Telegram angeben – antworten wir zusätzlich dort.
WhatsApp optional
Format: +Ländercode und Nummer (z. B. +49XXXXXXXXX).

Mit dem Klicken des Buttons stimmen Sie der Datenverarbeitung zu.