advanced
RTO / RPO
State recovery time and recovery point objectives so design cost matches downtime and data-loss tolerance. Связывайте target с user impact и verification.
RPO — максимально допустимая потеря данных во времени, насколько далеко откатываются бэкапы. RTO — максимальный downtime до восстановления сервиса. Жёстче цели — дороже: синхронная репликация, multi-region active-active, частые снимки.
Согласуйте с бизнес-влиянием: задержка email терпит минуты RPO; payment ledger — секунды. Инженерия предлагает варианты с ценой; продукт владеет компромиссом.
На интервью: RTO/RPO для core flow по промпту и инфраструктура под них.
Типовые ошибки: частота бэкапа путается с RPO без теста restore; RTO без DNS и прогрева кеша; одинаковые цели для всех tier данных.
Чеклист:
- RPO и RTO по критичным flow.
- Связь целей с репликацией и бэкапом.
- Проверка метриками restore drill.
- Tier целей по бизнес-влиянию.