advanced
Алертинг
Actionable алерты и service-level targets, обнаруживающие проблемы с impact на пользователей без заливания дежурных шумом.
На интервью по алертингу — reliability engineering и on-call: SLO, SLA, error budget и борьба с усталостью symptom-based pages и runbook'ами.
Подтемы: SLO, SLA, error budget, усталость от алертов.
На интервью: SLO для latency поиска; политика error budget на неделе релиза; когда page vs тикет в Slack.
Типовые ошибки: пороги по CPU; дубли pages на pod; нет ссылок на runbook.
Компромисс — раннее обнаружение инцидентов против выгорания дежурных.
Чеклист:
- SLI по пользовательским journey.
- Burn-rate алерты с окнами.
- Внутренний SLO строже SLA.
- Квартальная чистка алертов.