Три базы данных, которые 174 дня «работали» в аварийном режиме
Панель показывала, что всё синхронизировано, а по факту в трёх продакшн-кластерах PostgreSQL из трёх реплик жили две. Третья не могла присоединиться и перезапускалась по кругу - счётчик дошёл до девяти с лишним тысяч рестартов, и продолжалось это 174 дня. Побочный эффект, который и вскрыл проблему: сервер нельзя было вывести на плановое обслуживание, система не разрешала.
Чинил по одному кластеру, начиная с наименее критичного, чтобы отработать процедуру: временно уменьшал число реплик, освобождал зависшие тома и остатки данных на диске, возвращал реплику обратно и дожидался полной синхронизации. Клонирование новой реплики занимало около сорока секунд.
Результат: три реплики из трёх в каждом кластере, состояние healthy, сервер снова можно обслуживать. Отдельно убедился, что резервные копии в объектное хранилище продолжают идти уже после всех изменений - проверка бэкапов после работ обязательна, иначе можно починить одно и тихо сломать другое.