intermediate

Алерты

Уведомляйте людей только по actionable симптомам с user impact, ownership, severity и ссылкой на runbook.

Алерты превращают телеметрию в действия людей. Хорошие алерты пейджат по симптомам с impact на пользователей, с severity и ownership, со ссылками на дашборды или runbook для быстрой митигации.

| Хороший алерт | Плохой алерт | |---------------|--------------| | Рост ошибок checkout 5 мин | Любой 500 в логах | | Превышен burn rate SLO | CPU > 50% на одном pod | | Возраст очереди выше порога | Диск 60% без тренда |

Для SLO используйте multi-window burn-rate alerts. Маршрутизируйте по severity и часовому поясу с escalation.

На интервью: alert fatigue, burn-rate, actionable пороги, routing, escalation, maintenance windows и дисциплина paging.

Типовые ошибки: paging по причинам, а не симптомам; алерты без runbook; шумные правила никогда не пересматривают.

Компромисс — чувствительность (поймать всё рано) против устойчивости on-call.

Чеклист:

  • Алерт по user impact или угрозе SLO.
  • Контекст runbook в уведомлениях.
  • Регулярная настройка и срез шума.
  • Проверка путей алертов на game days.