advanced
Коммуникация при инцидентах
Сообщайте user impact, current status, mitigation, ownership, next update time и follow-up work при сбоях.
Incident communication синхронизирует users, support и leadership при сбоях: user impact, current status, mitigation, owner, next update и follow-up work. Спокойные частые updates снижают слухи и дублирование firefighting.
| Поле update | Зачем | |-------------|-------| | Impact | Кто не может что делать, severity | | Status | Investigating, mitigating, monitoring | | Actions | Rollback, flag, scale, patch | | Owner | Единый DRI координации | | Next update | Когда ждать новостей | | Workarounds | Временная подсказка пользователю |
[14:05] IMPACT: 8% checkout failures EU
STATUS: Mitigating — tax flag disabled 13:58
OWNER: @alex
NEXT: 14:20 или раньше если error rate >2%
WORKAROUND: retry через 2 min
На интервью: первые 15 минут outage — кого уведомить, что сказать, чего избегать (blame, ранний root cause).
Типовые ошибки: тихий engineering channel; противоречивые updates; нет ETA; забытый support; нет postmortem actions.
Компромисс — overhead updates под стрессом против доверия и быстрее coordinated response.
Чеклист:
- Impact в терминах пользователя первым.
- Один owner и cadence.
- Факты отдельно от гипотез.
- Follow-ups для postmortem.