intermediate
Эксплуатация runtime
Эксплуатируйте задеплоенные сервисы: health checks, probes, логи, метрики, алерты и базовая дисциплина реагирования на инциденты.
На интервью по runtime operations — здоровье сервисов в production: probes, структурированные логи, метрики у SLO, actionable алерты и дисциплинированное реагирование на инциденты.
Подтемы: health checks, readiness/liveness probes, логи, метрики, алерты, основы инцидентов.
На интервью: `/health/ready` для API с БД; один SLI и алерт; первые 15 минут аварии checkout.
Типовые ошибки: одинаковые liveness и readiness; PII в логах; high-cardinality метрики; paging на каждый error log.
Компромисс — полнота observability против стоимости, шума и устойчивости on-call.
Чеклист:
- Разделяйте readiness и liveness.
- Коррелируйте логи и метрики.
- Алерты по симптомам и burn SLO.
- Blameless инциденты с follow-up.