Аудиофайл следовало разделить на фрагменты и для каждого указать:
1 – преобладает тишина
2 – преобладает голос
3 – преобладает гудок
Для решения задачи был использован C++ и дополнительные библиотеки для обработки аудио, обеспечена кроссплатформенность.