Примеры работ и кейсы по направлению «Парсинг данных»

Ксения Бочкарева
Ксения Бочкарева 2 месяца назад
Ozon Bank History Parser: Автоматический сбор и фильтрация входящих переводов
Описание Заказчику требовалось автоматизировать обработку истории операций из личного кабинета Ozon Bank. Задача — извлечь из сохранённой HTML-страницы выписки даты, названия операций и суммы, корректно сопоставить каждую транзакцию с соответствующей датой в сложной DOM-структуре, отфильтровать только входящие платежи и подготовить данные к последующему импорту в учётные системы или финансовые отчёты. Решение • Разработала парсер на Python + BeautifulSoup для обработки локальных HTML-дампов выписки (оптимальный подход при наличии ограничений на прямой доступ к банковским API). • Реализовала алгоритм привязки транзакций к датам • Настроила очистку и извлечение данных: парсинг полного текста операции, выделение сумм регулярным выражением, удаление лишних пробелов и спецсимволов. • Добавила бизнес-фильтрацию: отбор только операций со знаком + (зачисления), что позволяет фокусироваться на входящих платежах и игнорировать списания.
Ксения Бочкарева
Ксения Бочкарева 2 месяца назад
MailGuard Bot: Парсер почты Mail.ru с детектором вредоносных ссылок и Telegram-уведомлениями
Описание Заказчику требовалось автоматизировать мониторинг входящих писем на корпоративном ящике Mail.ru с целью своевременного выявления фишинга, спама и опасных ссылок. Основная задача — в реальном времени анализировать новые сообщения, проверять все URL на принадлежность к чёрным спискам, подозрительным доменам и мгновенно уведомлять пользователя через Telegram, если обнаружена угроза. Это позволяет предотвратить утечку данных, переход по фишинговым страницам и заражение устройств. Решение • Настроила подключение к Mail.ru по протоколу IMAP с безопасной авторизацией и периодическим поллингом новых писем. • Реализовала парсинг тела письма (HTML/текст), извлечение всех гиперссылок и доменов с помощью регулярных выражений и HTML-парсеров. • Интегрировала многоуровневую проверку ссылок: – Сверка с локальными и облачными чёрными списками (PhishTank, Google Safe Browsing API) – Эвристический анализ доменов (подозрительные символы, схожесть с легитимными брендами, возраст домена) – Проверка редиректов и сокращённых ссылок (bit.ly, clck.ru и др.) • Разработала Telegram-бота для отправки структурированных алертов: тема письма, отправитель, опасная ссылка, уровень риска, рекомендации. • Добавила настройки пользователя: белый список доменов, чувствительность детектора, режим «тихой» проверки без спама.
Ксения Бочкарева
Ксения Бочкарева 2 месяца назад
Komus.ru Parser: Selenium-парсер с обходом Cloudflare для сбора данных о товарах
Заказчику требовалось автоматически получать актуальные данные о товарах с сайта Komus.ru (название, артикул, цена, наличие) через защищённый API-эндпоинт. Основная сложность — ресурс защищён Cloudflare, который блокирует стандартные запросы и детектирует автоматизацию. Задача: создать стабильный инструмент, который обходит защиту, извлекает чистые JSON-данные по коду товара и сохраняет их для дальнейшей интеграции с учётом, аналитикой или прайс-агрегаторами. Решение • Реализовала парсер на Python + Selenium с эмуляцией реального браузера: ротация user-agent, отключение флагов автоматизации, маскировка navigator.webdriver. • Настроила динамическое ожидание для прохождения проверок Cloudflare. • Добавила обработку ошибок: при неудаче сохраняется HTML-снапшот страницы для отладки, предусмотрен fallback-режим с видимым браузером для ручного контроля. • Реализовала парсинг и валидацию JSON-ответа, извлечение ключевых полей товара и сохранение в структурированный JSON-файл. • Обеспечила гибкость запуска: режим headless для продакшена и видимый режим для отладки, автоустановка драйвера через webdriver-manager.
Ксения Бочкарева
Ксения Бочкарева 2 месяца назад
Goofish Alert Bot: Telegram-парсер новых товаров с www.goofish.com в реальном времени
Заказчику требовался инструмент для мгновенного отслеживания появления новых товаров на торговой площадке Goofish.com. Основная задача — в автоматическом режиме мониторить сайт, обходя многоуровневую защиту от парсинга, и сразу уведомлять пользователей о свежих лотах через Telegram с полной карточкой товара: фото, название, описание, цена и прямая ссылка. Это критически важно для реселлеров и коллекционеров, которые хотят выкупать выгодные позиции первыми, до других покупателей. Решение • Разработала асинхронный парсер на Python с механизмами обхода anti-bot защиты: ротация прокси-серверов, динамические user-agent, эмуляция поведения реального пользователя, обход CAPTCHA. • Настроила мониторинг в реальном времени с интеллектуальным интервалом проверки (баланс между скоростью и незаметностью). • Реализовала извлечение и обработку данных: загрузка изображений товаров, парсинг названия и описания, извлечение цены с корректной обработкой валют, формирование прямых ссылок на лоты. • Интегрировала Telegram Bot API для отправки богатых уведомлений с фото (media group), форматированным текстом и inline-кнопками для быстрого перехода. • Добавила систему фильтрации: пользователь может настроить категории, ценовой диапазон, ключевые слова в описании, чтобы получать только релевантные уведомления. • Реализовала дедупликацию товаров и отслеживание уже отправленных лотов через базу данных.
Ксения Бочкарева
Ксения Бочкарева 2 месяца назад
Facebook Profile Parser: Модульный парсер с обходом защиты и динамическим сбором данных
Заказчику требовался инструмент для автоматизированного поиска и сбора публичных данных о пользователях Facebook по имени и фамилии. Задача включала два уровня парсинга: Массовый сбор базовой информации по всем найденным профилям (ссылка, аватар, количество подписчиков, место работы и учёбы). Глубокий парсинг динамических превью-карточек, которые подгружаются только при наведении курсора на имя пользователя. Основная сложность — структура Facebook использует обфусцированные, повторяющиеся CSS-классы и многоуровневую защиту от автоматизации, что делает стандартные парсеры неэффективными. Решение • Разработала модульную архитектуру парсера на Python: отдельный модуль для поиска пользователей, отдельный — для извлечения данных из динамических карточек. • Реализовала обход защиты от автоматизации: эмуляция поведения реального пользователя, ротация user-agent, использование резидентных прокси, маскировка признаков Selenium/Playwright. • Для работы с динамическим контентом применила подход на основе JavaScript-инъекций: эмуляция события mouseover, ожидание подгрузки карточки через MutationObserver, извлечение данных из временно появляющихся DOM-элементов. • Решила проблему обфусцированных классов: вместо селекторов по классам использовала поиск по атрибутам data-*, относительным XPath, текстовым меткам и иерархии элементов. • Настроила экспорт данных в структурированный JSON/CSV с дедупликацией профилей и логированием ошибок для отладки.
Ксения Бочкарева
Ксения Бочкарева 2 месяца назад
ContentVault AI: Локальная система архивации, транскрибации и AI-анализа медиа
Заказчику требовалась безопасная платформа для массовой загрузки, обработки и систематизации видео/аудио материалов (вебинары, лекции, подкасты, рабочие совещания). Главная задача — полностью оффлайн-транскрибация, автоматическое суммаризация контента через локальные нейросети, индексация по темам и мгновенный поиск по ключевым фразам без отправки данных в облако, что критично для соблюдения NDA и корпоративной безопасности. Решение • Разработала десктопное приложение на Python с современным GUI: drag-and-drop загрузка, очередь задач, панель прогресса и ручное управление пайплайном. • Интегрировала локальные нейросети: Whisper.cpp для высокоточной транскрибации, лёгкие LLM для суммаризации, извлечения тезисов и авто-тегирования. • Реализовала индексацию контента: полнотекстовый поиск (SQLite FTS) + векторный поиск (FAISS) для семантических запросов по смыслу. • Настроила умный поиск и навигацию: фильтрация по длительности/тегам/датам, подсветка найденных фрагментов в транскрипции, переход по таймкодам. • Обеспечила приватность и стабильность: работа без интернета, кэширование моделей, возобновление прерванных задач, экспорт в TXT/Markdown/PDF, логирование и валидация форматов.
Ксения Бочкарева
Ксения Бочкарева 2 месяца назад
AdSpy Monitor: Парсер рекламных креативов с AI-анализом и экспортной аналитикой
Заказчику требовался инструмент для конкурентной разведки: автоматический сбор рекламных креативов из соцсетей (VK, Telegram), анализ текстов и изображений через AI, отслеживание частоты показов и формирование сравнительных отчётов. Задача — выявить успешные стратегии конкурентов, скопировать лучшие практики и избежать чужих ошибок без ручного мониторинга. Решение • Разработала модульный парсер на Python: отдельные адаптеры под VK Ads, Telegram Ads (через эмуляцию мобильного API/веб-версии). • Реализовала обход базовых защит: ротация прокси, динамические заголовки, эмуляция скролла и кликов, обработка динамической подгрузки. • Внедрила AI-пайплайн: OCR + CLIP для анализа изображений, NLP-модель для классификации офферов («скидка», «лид-магнит», «вебинар»), извлечение УТП и призывов к действию. • Настроила трекинг частоты показов: сравнение скриншотов/метаданных во времени, детект новых/исчезнувших креативов, расчёт «времени жизни» рекламы. • Добавила экспорт в CSV/Excel с готовыми сводными таблицами: топ-креативы по длительности, частоте, вовлечённости (если доступно), с фильтрами по нише/формату/платформе.
АК
Антон Корнев 2 месяца назад
Универсальный парсер криптоновостей с интеграцией ИИ
Универсальный парсер статей с сайтов криптоновостей. В очередь RabbitMQ загружаются сайты с xpath и конрфигом, воркер асинхронно проходится по сайтам, извлекает название статьи, тест статьи, дату публикации, автора статьи. автоматически переводит название статьи на английский через google translate api. Если xpath не сработал делает поиск по метаданным og/meta/jsonld/readability. Последний fallback делается на внешний api для скрейпинга чтобы найти нужные поля через ИИ.
Андрей Шкуренко
Андрей Шкуренко 2 месяца назад
Парсинг сайтов и сбор данных в Excel / CSV / API
Собираю и дорабатываю парсеры сайтов для сбора, обработки и выгрузки данных в Excel, CSV, Google Sheets или через API. Помогаю автоматизировать ручной сбор информации: товары, цены, характеристики, контакты, таблицы, каталоги, отчёты и другие открытые данные. Что могу сделать: — собрать данные со страниц сайта; — очистить и структурировать информацию; — настроить выгрузку в Excel / CSV; — добавить фильтры, проверки и логирование; — исправить ошибки в существующем парсере; — подготовить инструкцию по запуску. Не беру задачи на обход капчи, взлом, спам, накрутки и обход защит сайтов. Работаю только с легальными сценариями и открытыми данными.
Дмитрий Макаров
Дмитрий Макаров 3 месяца назад
klio - сервис речевой аналитики
Сервис предусматривает модуль интеграции с сипуни и амо срм, дашборд, подключение к нейросетям и систему рейтинга для сотрудников