Начните с допустимого ущерба
RTO определяет, сколько времени сервис может быть недоступен. RPO — сколько данных допустимо потерять. Для бухгалтерии, склада и производственного контура эти значения могут различаться, поэтому архитектуру нельзя выбирать по общему требованию «чтобы не падало».
Разделите уровни отказа
Кластер серверов 1С умеет распределять нагрузку и поддерживать работу при отказе отдельных рабочих процессов или узлов. Но он не заменяет отказоустойчивую СУБД. Реплика PostgreSQL, в свою очередь, не защищает от логической ошибки, удаления данных или повреждения, которое успело реплицироваться.
В проекте отдельно рассматривают:
- серверы приложений 1С и их рабочие процессы;
- основной и резервный узлы СУБД;
- кворум и механизм переключения;
- общие зависимости: DNS, лицензии, сеть, хранилище и время;
- резервные копии и отдельную площадку восстановления.
Автоматическое переключение требует границ
Автоматизация полезна, когда система однозначно различает отказ и кратковременную потерю связи. Иначе два узла могут принять себя за основной. Поэтому проектируют fencing, кворум, наблюдение и процедуру ручного подтверждения для спорных ситуаций.
Восстановление проверяется целиком
Тест резервной копии заканчивается не запуском PostgreSQL, а входом в 1С, проверкой последних документов, фоновых заданий, интеграций и прав. Для физической копии PostgreSQL учитывают базовую копию и непрерывную цепочку WAL, а также срок их хранения.
Регулярное учение должно ответить на три вопроса: кто принимает решение о переключении, где находится инструкция и укладывается ли фактическое восстановление в RTO/RPO.

