intermediate

Эксплуатация runtime

Эксплуатируйте задеплоенные сервисы: health checks, probes, логи, метрики, алерты и базовая дисциплина реагирования на инциденты.

На интервью по runtime operations — здоровье сервисов в production: probes, структурированные логи, метрики у SLO, actionable алерты и дисциплинированное реагирование на инциденты.

Подтемы: health checks, readiness/liveness probes, логи, метрики, алерты, основы инцидентов.

На интервью: `/health/ready` для API с БД; один SLI и алерт; первые 15 минут аварии checkout.

Типовые ошибки: одинаковые liveness и readiness; PII в логах; high-cardinality метрики; paging на каждый error log.

Компромисс — полнота observability против стоимости, шума и устойчивости on-call.

Чеклист:

  • Разделяйте readiness и liveness.
  • Коррелируйте логи и метрики.
  • Алерты по симптомам и burn SLO.
  • Blameless инциденты с follow-up.