advanced
Availability
Keep the service usable through redundancy, failover, graceful degradation, health checks, and dependency isolation. Связывайте target с user impact и verification.
Доступность — могут ли пользователи завершить критичные сценарии при сбоях. Повышайте резервированием, failover с health check, multi-AZ, circuit breaker и graceful degradation — кешированный или частичный ответ при падении зависимостей.
Цели в nines (99.9%, 99.99%) с допустимым downtime в месяц. Проверяйте synthetic probe и error budget, не допущениями. Изолируйте зависимости, чтобы медленный payment provider не вешал checkout.
На интервью: переведите 99.9% в минуты downtime, degradation для рекомендаций и резервирование в дизайне.
Типовые ошибки: доступность только на LB при росте ошибок приложения; нет timeout зависимостей; каскад без bulkhead.
Чеклист:
- SLO доступности и влияние на пользователя.
- Резервирование и failover с health check.
- Деградация некритичных фич под нагрузкой.
- Изоляция зависимостей: timeout и breaker.