Команде разработки нужно было сразу узнавать о боевых ошибках сервиса, а не дежурить в логах на сервере.
Написал микросервис на Python: каждые 30 секунд читает логи, группирует одинаковые ошибки, оценивает серьёзность и шлёт уведомления в Telegram — без спама, с защитой от повторов. Багами можно управлять прямо из чата кнопками «Взять», «Решено», «Игнорировать», раз в день приходит сводка. Всё в Docker, в основное приложение не лезет: логи читаются только на чтение.
Реакция на инциденты упала с часов до минут, и ни одна повторяющаяся ошибка не теряется.