intermediate

Observability

Логирование, метрики, traces, alerting, service-level targets и инструменты для понимания поведения production в FullStack JavaScript-системах.

На интервью по observability проверяют, умеете ли вы понимать поведение production по сигналам — а не заучивать каждую панель Grafana. Сильные ответы связывают логи, метрики, traces, alerting и инструменты с impact на пользователей, SLO и реагированием на инциденты.

Домен охватывает logging (структурированные события, уровни, correlation, безопасность PII), metrics (RED, USE, бизнес-KPI, основы Prometheus), tracing (spans, trace ID, OpenTelemetry), alerting (SLO, SLA, error budget, усталость от алертов) и распространённые tools (Grafana, Prometheus, Loki, Datadog, Sentry, New Relic).

На интервью: при аварии checkout — какой SLI смотрите, какие логи и traces запрашиваете, как correlation ID связывает ошибки frontend с API-логами и когда page vs ticket.

Типовые ошибки: метрики без пользовательских SLI; PII в логах; tracing рвётся на очередях; paging по объёму логов; покупка APM без стандартов instrumentation.

Компромисс — полнота observability против стоимости, cardinality, privacy и устойчивости on-call.

Чеклист:

  • Golden signals на критичный journey.
  • Корреляция логов, метрик и traces общими ID.
  • Алерты по симптомам и burn SLO.
  • Углубление через дочерние темы по типу сигнала.