BAĞLAM
Yüksek trafikli ve birden fazla bağımlılığı bulunan servisler için anonimleştirilmiş SRE çalışma örneği.
- Kubernetes
- Prometheus
- Grafana
- SLO
Zorluk
- Altyapı metrikleri görünür olsa da kullanıcıların yaşadığı hata ve gecikmeler kolayca ilişkilendirilemiyordu.
- Gürültülü alarmlar nöbet yükünü artırıyor, gerçek sorunların önceliklendirilmesini zorlaştırıyordu.
- Pod yeniden başlatmaları ve kapasite baskısı çoğunlukla olay gerçekleştikten sonra inceleniyordu.
Yaklaşım
- Erişilebilirlik, hata oranı ve gecikme için servis seviyesi göstergeleri tanımlandı.
- Dashboard'lar servis, Kubernetes ve bağımlılık sinyallerini aynı olay akışında gösterecek şekilde düzenlendi.
- Alarmlar kısa süreli dalgalanmalardan çok kullanıcı etkisine ve hata bütçesi tüketimine bağlandı.
- Pod yaşam döngüsü, kaynak doygunluğu ve dağıtım değişiklikleri olay inceleme akışına eklendi.
Sonuç
- Alarm incelemelerinde kullanıcı etkisini belirlemek için ortak bir dil oluştu.
- Kapasite, uygulama hatası ve bağımlılık kaynaklı sorunların ayrıştırılması kolaylaştı.
- Olay sonrası değerlendirmeler ölçülebilir güvenilirlik hedefleri üzerinden yürütülebilir hâle geldi.
Çıkarımlar
- Her ölçülebilen sinyal alarm olmamalıdır; alarmın sahibi ve beklenen eylemi belli olmalıdır.
- SLO, yalnızca dashboard üzerinde duran bir oran değil, önceliklendirme ve risk kararı aracıdır.