Задача: команда деплоила вручную по SSH, релиз занимал час-полтора, единого мониторинга Kubernetes-кластера не было — о проблемах узнавали от пользователей, а не от системы.
Решение: настроил GitLab CI/CD с автотестами и автодеплоем по тегам, поднял мониторинг кластера на Prometheus + Grafana (kube-state-metrics) — количество подов/контейнеров в реальном времени, статус конфигурации компонентов, лог событий с алертами при failed readiness/liveness probe.
Результат: время деплоя сократилось с часа до 5-10 минут, проблемы с подами стали видны за секунды по логу событий, а не через жалобы пользователей.