advanced

Алертинг

Actionable алерты и service-level targets, обнаруживающие проблемы с impact на пользователей без заливания дежурных шумом.

На интервью по алертингу — reliability engineering и on-call: SLO, SLA, error budget и борьба с усталостью symptom-based pages и runbook'ами.

Подтемы: SLO, SLA, error budget, усталость от алертов.

На интервью: SLO для latency поиска; политика error budget на неделе релиза; когда page vs тикет в Slack.

Типовые ошибки: пороги по CPU; дубли pages на pod; нет ссылок на runbook.

Компромисс — раннее обнаружение инцидентов против выгорания дежурных.

Чеклист:

  • SLI по пользовательским journey.
  • Burn-rate алерты с окнами.
  • Внутренний SLO строже SLA.
  • Квартальная чистка алертов.