intermediate

Основы инцидентов

Координируйте обнаружение, triage, митигацию, коммуникацию, обучение из postmortem и follow-up при production-сбоях.

Реагирование на инциденты координирует обнаружение, triage, митигацию, коммуникацию и обучение, когда production вредит пользователям. Сначала безопасно восстановите сервис; идеальный root cause может подождать.

| Роль | Ответственность | |------|-----------------| | Incident commander | Координация решений и коммуникации | | Technical lead | Митигация и расследование | | Comms lead | Обновления стейкхолдеров и клиентов | | Scribe | Таймлайн и лог действий |

Типичный поток: acknowledge → оценка severity → митигация (rollback, scale, feature flag, сдвиг трафика) → коммуникация → стабилизация → postmortem с follow-up тикетами.

На интервью: роли commander, уровни severity, rollback vs forward fix, обновления клиентам при неопределённости, blameless postmortem и ownership action items.

Типовые ошибки: обвинение людей; долгая тишина для клиентов; митигация без таймлайна; postmortem без отслеживаемых follow-up.

Компромисс — скорость митигации против дисциплины коммуникации и обучения.

Чеклист:

  • Роли назначать рано.
  • Митигировать до идеального диагноза.
  • Регулярно сообщать impact и статус.
  • Blameless postmortem с owned follow-up.