intermediate
Алерты
Уведомляйте людей только по actionable симптомам с user impact, ownership, severity и ссылкой на runbook.
Алерты превращают телеметрию в действия людей. Хорошие алерты пейджат по симптомам с impact на пользователей, с severity и ownership, со ссылками на дашборды или runbook для быстрой митигации.
| Хороший алерт | Плохой алерт | |---------------|--------------| | Рост ошибок checkout 5 мин | Любой 500 в логах | | Превышен burn rate SLO | CPU > 50% на одном pod | | Возраст очереди выше порога | Диск 60% без тренда |
Для SLO используйте multi-window burn-rate alerts. Маршрутизируйте по severity и часовому поясу с escalation.
На интервью: alert fatigue, burn-rate, actionable пороги, routing, escalation, maintenance windows и дисциплина paging.
Типовые ошибки: paging по причинам, а не симптомам; алерты без runbook; шумные правила никогда не пересматривают.
Компромисс — чувствительность (поймать всё рано) против устойчивости on-call.
Чеклист:
- Алерт по user impact или угрозе SLO.
- Контекст runbook в уведомлениях.
- Регулярная настройка и срез шума.
- Проверка путей алертов на game days.