Портфолио и кейсы фрилансеров по парсингу данных

Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
VoiceNote AI: Диктофон с локальной транскрибацией, умным поиском и авто-тегированием
Описание Заказчику требовалось Android-приложение для быстрой и конфиденциальной фиксации голосовых заметок, лекций и рабочих совещаний. Ключевая задача — полностью оффлайн-транскрибация речи в текст, автоматическая категоризация записей по темам/тегам и мгновенный полнотекстовый поиск по всей библиотеке. Решение должно работать без отправки данных в облако, соответствовать стандартам приватности (NDA/GDPR) и иметь современный, отзывчивый интерфейс для ежедневного использования. Решение • Разработала нативное приложение на Kotlin с использованием Jetpack Compose и архитектуры MVVM + Clean Architecture. • Интегрировала локальную ML-модель для транскрибации речи в реальном времени и пост-обработки аудиофайлов прямо на устройстве. • Реализовала авто-тегирование на основе лёгкого NLP-пайплайна: извлечение ключевых сущностей, дат, имён и тем с возможностью ручной корректировки и дообучения на пользовательских примерах. • Настроила полнотекстовый поиск через Room + FTS5: мгновенный поиск по транскрипциям, подсветка найденных фрагментов, фильтрация по тегам/датам/длительности. • Оптимизировала фоновую работу: Foreground Service для записи, WorkManager для асинхронной обработки, энергоэффективные аудио-настройки, шифрование локальной базы данных.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
TG Audience Builder & Outreach: Парсер целевой аудитории и автоматизированная рассылка в Telegram
Описание Заказчику требовался инструмент для точечного привлечения клиентов из тематических Telegram-каналов и групп. Задача: автоматически собрать базу активных пользователей по заданным параметрам (тематика, наличие username, примерная активность), а затем реализовать безопасную рассылку персональных офферов через пул собственных Telegram-аккаунтов. Ключевое требование — минимизировать риски ограничений со стороны платформы, обеспечить высокую доставляемость и персонализацию сообщений без ручного вмешательства. Решение • Разработала модуль парсинга на Pyrogram с подключением к Telegram API: сбор участников каналов/групп, автоматическая фильтрация ботов, закрытых аккаунтов и неактивных профилей. • Реализовала систему управления аккаунтами: загрузка сессионных файлов, интеллектуальная ротация, имитация «прогрева», рандомизация интервалов между сообщениями. • Настроила шаблонизатор рассылок: поддержка динамических переменных ({name}, {source_channel}), чередование текстов, встроенные лимиты на сообщения/аккаунт/день. • Добавила мониторинг и защиту: отслеживание ошибок отправки, автоматическая пауза при срабатывании лимитов Telegram, детальное логирование статусов (доставлено/отклонено/ошибка). • Обеспечила гибкость конфигурации: выбор целевых каналов/групп, настройка порогов активности, режим фонового выполнения с возможностью запуска по расписанию.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
Telegram-бот: Парсер и умный уведомитель для аналитики ставок Stake
Описание Заказчику требовался инструмент для автоматического мониторинга ставок на платформе Stake в реальном времени. Ключевая задача — стабильно обходить многоуровневую защиту от автоматизации, собирать структурированные данные (событие, дата, вид спорта, объект ставки, коэффициент, дата и сумма ставки) и оперативно доставлять их пользователям через Telegram с возможностью гибкой фильтрации по интересующим параметрам. Решение • Разработала отказоустойчивый парсер с механизмами обхода anti-bot защиты: ротация прокси, динамические заголовки, эмуляция поведения реального пользователя. • Настроила сбор, очистку и нормализацию данных по заданным полям. • Интегрировала Telegram Bot API для отправки персонализированных, легко читаемых уведомлений. • Реализовала систему пользовательских фильтров (вид спорта, диапазон коэффициентов, минимальная сумма, дата), позволяющую боту отправлять только релевантные события. • Добавила логирование, автоматическое восстановление сессий и обработку сетевых ошибок для работы в режиме 24/7.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
ReviewMiner: Система сбора и AI-анализа отзывов с маркетплейсов и карт
Описание Клиенту требовался инструмент для автоматического мониторинга репутации бренда на площадках (Ozon, Wildberries, Яндекс.Карты, 2GIS). Задача: собирать отзывы в реальном времени, определять тональность через локальную ML-модель, кластеризовать жалобы и похвалы по темам, и формировать наглядный дашборд для отдела качества и маркетинга. Критически важны: работа без отправки данных в облако, высокая точность классификации и возможность экспорта отчётов. Решение • Разработала распределённый парсер на Python с обходом базовых защит: ротация user-agent, задержки, эмуляция поведения, работа через резидентные прокси. • Внедрила пайплайн анализа на локальных моделях: классификатор тональности, NER для извлечения сущностей, кластеризация тем. • Реализовала дашборд: фильтры по дате/площадке/рейтингу, тепловая карта жалоб, тренды тональности, экспорт в Excel/CSV. • Настроила умные уведомления в Telegram: алерты при всплеске негатива, новых жалобах на критичные темы, изменении среднего рейтинга. • Обеспечила приватность и масштабируемость: все модели работают оффлайн, данные хранятся локально, архитектура позволяет подключить новые площадки за 1–2 часа.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
PriceWatch Engine: Мониторинг цен конкурентов с AI-прогнозом и Telegram-алертами
Описание Клиенту требовалась автоматизированная система отслеживания цен на маркетплейсах и сайтах конкурентов. Задача: в реальном времени собирать данные по SKU, обходить сложные защиты, выявлять реальные скидки и «фейковые» акции, прогнозировать динамику цен и мгновенно уведомлять ответственных менеджеров через Telegram. Критически важны: точность, масштабируемость, минимальная нагрузка на инфраструктуру и фильтрация информационного шума. Решение • Разработала распределённый парсер на Python с кластером резидентных прокси и ротацией цифровых отпечатков браузера для стабильного обхода anti-bot систем. • Реализовала эвристический анализ скидок: сравнение с историческими данными, выявление искусственных наценок перед распродажами, расчёт реальной выгоды для покупателя. • Внедрила модель прогнозирования динамики цен на основе временных рядов (Prophet/LightGBM), обучающуюся на собранной истории без ручных настроек. • Настроила Telegram-бота с умными уведомлениями: пороговые триггеры, форматированные карточки товаров, inline-кнопки для перехода, экспорта или игнорирования. • Добавила отказоустойчивый пайплайн: Celery + Redis для очередей задач, дедупликация, автоматический ретрай при блокировках, детальное логирование.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
Ozon Bank History Parser: Автоматический сбор и фильтрация входящих переводов
Описание Заказчику требовалось автоматизировать обработку истории операций из личного кабинета Ozon Bank. Задача — извлечь из сохранённой HTML-страницы выписки даты, названия операций и суммы, корректно сопоставить каждую транзакцию с соответствующей датой в сложной DOM-структуре, отфильтровать только входящие платежи и подготовить данные к последующему импорту в учётные системы или финансовые отчёты. Решение • Разработала парсер на Python + BeautifulSoup для обработки локальных HTML-дампов выписки (оптимальный подход при наличии ограничений на прямой доступ к банковским API). • Реализовала алгоритм привязки транзакций к датам • Настроила очистку и извлечение данных: парсинг полного текста операции, выделение сумм регулярным выражением, удаление лишних пробелов и спецсимволов. • Добавила бизнес-фильтрацию: отбор только операций со знаком + (зачисления), что позволяет фокусироваться на входящих платежах и игнорировать списания.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
MailGuard Bot: Парсер почты Mail.ru с детектором вредоносных ссылок и Telegram-уведомлениями
Описание Заказчику требовалось автоматизировать мониторинг входящих писем на корпоративном ящике Mail.ru с целью своевременного выявления фишинга, спама и опасных ссылок. Основная задача — в реальном времени анализировать новые сообщения, проверять все URL на принадлежность к чёрным спискам, подозрительным доменам и мгновенно уведомлять пользователя через Telegram, если обнаружена угроза. Это позволяет предотвратить утечку данных, переход по фишинговым страницам и заражение устройств. Решение • Настроила подключение к Mail.ru по протоколу IMAP с безопасной авторизацией и периодическим поллингом новых писем. • Реализовала парсинг тела письма (HTML/текст), извлечение всех гиперссылок и доменов с помощью регулярных выражений и HTML-парсеров. • Интегрировала многоуровневую проверку ссылок: – Сверка с локальными и облачными чёрными списками (PhishTank, Google Safe Browsing API) – Эвристический анализ доменов (подозрительные символы, схожесть с легитимными брендами, возраст домена) – Проверка редиректов и сокращённых ссылок (bit.ly, clck.ru и др.) • Разработала Telegram-бота для отправки структурированных алертов: тема письма, отправитель, опасная ссылка, уровень риска, рекомендации. • Добавила настройки пользователя: белый список доменов, чувствительность детектора, режим «тихой» проверки без спама.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
Komus.ru Parser: Selenium-парсер с обходом Cloudflare для сбора данных о товарах
Заказчику требовалось автоматически получать актуальные данные о товарах с сайта Komus.ru (название, артикул, цена, наличие) через защищённый API-эндпоинт. Основная сложность — ресурс защищён Cloudflare, который блокирует стандартные запросы и детектирует автоматизацию. Задача: создать стабильный инструмент, который обходит защиту, извлекает чистые JSON-данные по коду товара и сохраняет их для дальнейшей интеграции с учётом, аналитикой или прайс-агрегаторами. Решение • Реализовала парсер на Python + Selenium с эмуляцией реального браузера: ротация user-agent, отключение флагов автоматизации, маскировка navigator.webdriver. • Настроила динамическое ожидание для прохождения проверок Cloudflare. • Добавила обработку ошибок: при неудаче сохраняется HTML-снапшот страницы для отладки, предусмотрен fallback-режим с видимым браузером для ручного контроля. • Реализовала парсинг и валидацию JSON-ответа, извлечение ключевых полей товара и сохранение в структурированный JSON-файл. • Обеспечила гибкость запуска: режим headless для продакшена и видимый режим для отладки, автоустановка драйвера через webdriver-manager.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
Goofish Alert Bot: Telegram-парсер новых товаров с www.goofish.com в реальном времени
Заказчику требовался инструмент для мгновенного отслеживания появления новых товаров на торговой площадке Goofish.com. Основная задача — в автоматическом режиме мониторить сайт, обходя многоуровневую защиту от парсинга, и сразу уведомлять пользователей о свежих лотах через Telegram с полной карточкой товара: фото, название, описание, цена и прямая ссылка. Это критически важно для реселлеров и коллекционеров, которые хотят выкупать выгодные позиции первыми, до других покупателей. Решение • Разработала асинхронный парсер на Python с механизмами обхода anti-bot защиты: ротация прокси-серверов, динамические user-agent, эмуляция поведения реального пользователя, обход CAPTCHA. • Настроила мониторинг в реальном времени с интеллектуальным интервалом проверки (баланс между скоростью и незаметностью). • Реализовала извлечение и обработку данных: загрузка изображений товаров, парсинг названия и описания, извлечение цены с корректной обработкой валют, формирование прямых ссылок на лоты. • Интегрировала Telegram Bot API для отправки богатых уведомлений с фото (media group), форматированным текстом и inline-кнопками для быстрого перехода. • Добавила систему фильтрации: пользователь может настроить категории, ценовой диапазон, ключевые слова в описании, чтобы получать только релевантные уведомления. • Реализовала дедупликацию товаров и отслеживание уже отправленных лотов через базу данных.
Ксения Бочкарева
Ксения Бочкарева 4 месяца назад
Facebook Profile Parser: Модульный парсер с обходом защиты и динамическим сбором данных
Заказчику требовался инструмент для автоматизированного поиска и сбора публичных данных о пользователях Facebook по имени и фамилии. Задача включала два уровня парсинга: Массовый сбор базовой информации по всем найденным профилям (ссылка, аватар, количество подписчиков, место работы и учёбы). Глубокий парсинг динамических превью-карточек, которые подгружаются только при наведении курсора на имя пользователя. Основная сложность — структура Facebook использует обфусцированные, повторяющиеся CSS-классы и многоуровневую защиту от автоматизации, что делает стандартные парсеры неэффективными. Решение • Разработала модульную архитектуру парсера на Python: отдельный модуль для поиска пользователей, отдельный — для извлечения данных из динамических карточек. • Реализовала обход защиты от автоматизации: эмуляция поведения реального пользователя, ротация user-agent, использование резидентных прокси, маскировка признаков Selenium/Playwright. • Для работы с динамическим контентом применила подход на основе JavaScript-инъекций: эмуляция события mouseover, ожидание подгрузки карточки через MutationObserver, извлечение данных из временно появляющихся DOM-элементов. • Решила проблему обфусцированных классов: вместо селекторов по классам использовала поиск по атрибутам data-*, относительным XPath, текстовым меткам и иерархии элементов. • Настроила экспорт данных в структурированный JSON/CSV с дедупликацией профилей и логированием ошибок для отладки.