intermediate
Основы инцидентов
Координируйте обнаружение, triage, митигацию, коммуникацию, обучение из postmortem и follow-up при production-сбоях.
Реагирование на инциденты координирует обнаружение, triage, митигацию, коммуникацию и обучение, когда production вредит пользователям. Сначала безопасно восстановите сервис; идеальный root cause может подождать.
| Роль | Ответственность | |------|-----------------| | Incident commander | Координация решений и коммуникации | | Technical lead | Митигация и расследование | | Comms lead | Обновления стейкхолдеров и клиентов | | Scribe | Таймлайн и лог действий |
Типичный поток: acknowledge → оценка severity → митигация (rollback, scale, feature flag, сдвиг трафика) → коммуникация → стабилизация → postmortem с follow-up тикетами.
На интервью: роли commander, уровни severity, rollback vs forward fix, обновления клиентам при неопределённости, blameless postmortem и ownership action items.
Типовые ошибки: обвинение людей; долгая тишина для клиентов; митигация без таймлайна; postmortem без отслеживаемых follow-up.
Компромисс — скорость митигации против дисциплины коммуникации и обучения.
Чеклист:
- Роли назначать рано.
- Митигировать до идеального диагноза.
- Регулярно сообщать impact и статус.
- Blameless postmortem с owned follow-up.