Детектор растяжений речи: Whisper + CatBoost, ROC-AUC 0.90
Личный проект. Пайплайн, который находит в записи речи растянутые звуки — один из маркеров заикания.
Как устроено: из аудио извлекаются покадровые эмбеддинги Whisper-small (слои 8, 10 и 11 энкодера, 2304 признака на каждые 20 мс), поверх них обучается CatBoost, предсказания сглаживаются медианным фильтром.
Результат — не ноутбук, а готовый скрипт: берёт исходный TextGrid, добавляет в него слой disfluencies и записывает найденные интервалы.
Качество: ROC-AUC 0.96 на валидации и 0.90 на отложенном тесте с дикторами, которых модель не слышала. Второе число важнее первого: оно показывает, что модель не запомнила голоса, а научилась слышать сам признак.
Стек: Python, PyTorch, Whisper, CatBoost, praat-textgrids.
Весь код открыт на GitHub — можно посмотреть до заказа.