Распознаю речь локально, без облачных сервисов, — материал никуда не уходит. Текст режу на реплики по паузам, а не по числу знаков, поэтому строки совпадают с речью и читаются на экране. На выходе — файл субтитров и, если нужно, видео с уже вшитой дорожкой.