Парсеры: страница или видео на входе — чистый структурированный текст на выходе
Задача: перестать вручную копировать содержимое страниц, статей и видео в рабочую базу.
Что сделано: три входа под разные типы источников. Первый: забор страницы браузерным движком с
отрисовкой скриптов, извлечение основного содержимого в чистый Markdown с шапкой — источник,
заголовок, дата, статус; категория раскладывает файл по папкам. Одна команда, есть режим
сухого прогона. Второй: изолированный
контур для субтитров видео, страниц через reader-прокси и RSS. Третий: синхронизация внешнего
репозитория в данные приложения одной командой: извлечение → проверка → преобразование → запись,
с полями происхождения (репозиторий, коммит, дата) в каждом файле.
Две вещи, которые отличают рабочий парсер от одноразового скрипта. Первая: красные линии закреплены
в самой установке — логины не подключаются, площадки, живущие только на cookie-логине, в контур
не входят: доступны 4 канала из 15, ровно беcлогиновые.
Вторая: вывод принудительно в UTF-8, потому что консоль Windows по умолчанию в другой кодировке
и кириллица приходит битой — на этом ломается большинство самодельных парсеров.
Рядом лежат журналы смоук-прогонов по трём разным сайтам: проверка была не «в теории».
Стек: Python, crawl4ai и Playwright, yt-dlp, Jina Reader, RSS, изолированные окружения.
Это внедрение в моей собственной инфраструктуре, а не работа по заказу внешнего клиента. Моя
роль: постановка задачи, техническое задание, приёмка и эксплуатация.