intermediate
Усталость от алертов
Снижайте шумные, бесполезные, дублирующиеся и flapping алерты, чтобы дежурные доверяли pages при реальных инцидентах.
Усталость от алертов — слишком много шумных, дублирующихся или бесполезных pages. Доверие падает; реальные инциденты пропускают. Хороший alerting — продукт: симптомы, владельцы, runbook и циклы настройки.
| Антипаттерн | Исправление | |-------------|-------------| | Page на каждый error log | Агрегация; алерт по burn SLO | | Дубликат на реплику | Группировка по service/region | | Flapping порога | `for`, гистерезис | | Нет runbook | Ссылка на дашборд + первые шаги |
symptom-based → пользователь не может checkout (SLO)
cause-based → pod restarted (тикет, не page)
Меряйте качество: pages в неделю, ack без действия, MTTA vs MTTR. Удаляйте алерты без действий 90 дней.
На интервью: paging vs ticketing, устойчивость on-call и боль клиента vs внутренний шум.
Типовые ошибки: page на зависимости, которые нельзя починить в 3am; пороги из блогов; нет владельца алерта.
Компромисс — пропуск редких сбоев против выгорания on-call.
Чеклист:
- Page по симптомам с impact на пользователя.
- У каждого page — owner и runbook.
- Квартальная чистка алертов.
- Открытые метрики усталости.