advanced

Коммуникация при инцидентах

Сообщайте user impact, current status, mitigation, ownership, next update time и follow-up work при сбоях.

Incident communication синхронизирует users, support и leadership при сбоях: user impact, current status, mitigation, owner, next update и follow-up work. Спокойные частые updates снижают слухи и дублирование firefighting.

| Поле update | Зачем | |-------------|-------| | Impact | Кто не может что делать, severity | | Status | Investigating, mitigating, monitoring | | Actions | Rollback, flag, scale, patch | | Owner | Единый DRI координации | | Next update | Когда ждать новостей | | Workarounds | Временная подсказка пользователю |

					[14:05] IMPACT: 8% checkout failures EU
STATUS: Mitigating — tax flag disabled 13:58
OWNER: @alex
NEXT: 14:20 или раньше если error rate >2%
WORKAROUND: retry через 2 min
				

На интервью: первые 15 минут outage — кого уведомить, что сказать, чего избегать (blame, ранний root cause).

Типовые ошибки: тихий engineering channel; противоречивые updates; нет ETA; забытый support; нет postmortem actions.

Компромисс — overhead updates под стрессом против доверия и быстрее coordinated response.

Чеклист:

  • Impact в терминах пользователя первым.
  • Один owner и cadence.
  • Факты отдельно от гипотез.
  • Follow-ups для postmortem.