intermediate

Усталость от алертов

Снижайте шумные, бесполезные, дублирующиеся и flapping алерты, чтобы дежурные доверяли pages при реальных инцидентах.

Усталость от алертов — слишком много шумных, дублирующихся или бесполезных pages. Доверие падает; реальные инциденты пропускают. Хороший alerting — продукт: симптомы, владельцы, runbook и циклы настройки.

| Антипаттерн | Исправление | |-------------|-------------| | Page на каждый error log | Агрегация; алерт по burn SLO | | Дубликат на реплику | Группировка по service/region | | Flapping порога | `for`, гистерезис | | Нет runbook | Ссылка на дашборд + первые шаги |

					symptom-based → пользователь не может checkout (SLO)
cause-based   → pod restarted (тикет, не page)
				

Меряйте качество: pages в неделю, ack без действия, MTTA vs MTTR. Удаляйте алерты без действий 90 дней.

На интервью: paging vs ticketing, устойчивость on-call и боль клиента vs внутренний шум.

Типовые ошибки: page на зависимости, которые нельзя починить в 3am; пороги из блогов; нет владельца алерта.

Компромисс — пропуск редких сбоев против выгорания on-call.

Чеклист:

  • Page по симптомам с impact на пользователя.
  • У каждого page — owner и runbook.
  • Квартальная чистка алертов.
  • Открытые метрики усталости.