Примеры работ и кейсы по направлению «Парсинг данных»

Денис Рыпалов
Денис Рыпалов 5 месяцев назад
Telegram-бот мониторинга туров с парсингом API турагентства
Разработал Telegram-бота для турагентства, который в реальном времени отслеживает появление выгодных туров и мгновенно уведомляет менеджеров. Бот самостоятельно запускает поиск через нестандартное API (реверс-инжиниринг через DevTools), обходит постраничную пагинацию, фильтрует туры по бюджету и отправляет карточку с отелем и ценой в Telegram. Стек: Python, Requests, Telegram Bot API, Tourvisor API
Михаил Башов
Михаил Башов 5 месяцев назад
VK Social Media Parser
VK Social Media Parser Асинхронный распределённый парсер данных ВКонтакте на базе Scrapy, предназначенный для масштабного сбора и хранения публичного контента сообществ. Стек: Python, Scrapy, MongoDB, Docker, VK API Возможности: Парсинг метаданных групп (подписчики, аватары, статистика) через VK Execute API с батчингом до 350 групп за запрос Сбор постов с фильтрацией по дате последнего сохранённого поста в БД — исключает повторную загрузку Разделение рекламных и органических постов в отдельные коллекции MongoDB Пакетная вставка постов (буфер 500 записей) для минимизации нагрузки на БД Ротация прокси и токенов VK-аккаунтов с автоматической проверкой работоспособности перед запуском Горизонтальное масштабирование: N процессов × M пауков, каждый со своим токеном и прокси Обработка rate-limit ошибок VK API (error 6, 13, 29) с сохранением прогресса в JSON-логи Автоматическое сжатие изображений (JPEG, настраиваемое качество) с выгрузкой в S3-совместимое хранилище Деплой через Docker Compose с cron-расписанием и volume-маппингом для данных и логов
Михаил Башов
Михаил Башов 5 месяцев назад
Plibber Telegram Channel Parser
Асинхронный парсер Telegram-каналов для plibber.ru на Python с поддержкой многопоточной обработки и ротацией аккаунтов. Основные возможности: Сбор метаданных каналов и постов через Telegram API (Telethon) Три режима работы: CHANNELS, POSTS, VERIFICATION Умное управление аккаунтами: ротация, отслеживание FloodWait, резервный пул Загрузка медиафайлов (аватары, фото постов) в S3-совместимое хранилище Хранение данных в MongoDB с батчевой обработкой Поддержка HTTP/SOCKS5 прокси с автораспределением нагрузки Контейнеризация через Docker Стек: Python 3.10, Telethon, Motor (async MongoDB), aiohttp, Boto3, BeautifulSoup, Playwright, Poetry
Артем Беспалов
Артем Беспалов 5 месяцев назад
Парсинг товарных позиций John Deere
Продолжение работы с парсингом сайта John Deere. Заказчику было необходимо собрать подробные данные по каждой товарной позиции.
Артем Беспалов
Артем Беспалов 5 месяцев назад
Парсинг изображений товаров John Deere
Заказчику было необходимо собрать все изображения с сайта John Deere в формате "Изображение - Артикул". В результате было собрано 589 906 изображений товарных позиций
Ivan Gerasimov
Ivan Gerasimov 5 месяцев назад
Разработаю Telegram Mini App магазин с AI-менеджером под ключ
Готовый интернет-магазин внутри Telegram с живым каталогом товаров, корзиной и умным менеджером на базе искусственного интеллекта. https://t.me/olmi_connect_store_bot Полный функционал: — Каталог товаров с поиском и фильтрацией — Корзина с подсчетом суммы — Авторизация через Telegram (1 клик) — Личный кабинет с историей заказов — Адаптивный дизайн (идеально на телефоне) AI-менеджер 24/7: Отвечает на вопросы клиентов, консультирует по товарам, помогает с оформлением — полностью автоматически, как живой человек. Для каких товаров подходит: — Телекоммуникационное оборудование — Строительные материалы — Одежда и аксессуары — Любые товары с фотографиями Почему это выгодно: — Менеджер работает круглосуточно без выходных — Не нужно разрабатывать мобильное приложение Что входит в стоимость: — Разработка Mini App под ваш каталог — Настройка AI-менеджера — Интеграция с Telegram ботом — Система приема заказов — Исходный код + инструкция — 7 дней бесплатной поддержки Пишите в личные сообщения: — Пришлите ваш прайс или каталог — Я покажу пример готового магазина — Обсудим детали и сроки
ПГ
Павел Грицай 5 месяцев назад
Система автоматического сбора коэффициентов с антидетект-браузером и GU
Разработана система для автоматического сбора коэффициентов (Over/Under) с крупного спортивного сайта. • Проведён реверс-инжиниринг URL для доступа к таблицам. • Использован антидетект-браузер AdsPower на случай блокировок. • Создан графический интерфейс на Godot с визуализацией результатов (подсветка лучших коэффициентов). Стек: Python, Playwright, AdsPower API, Godot (GDScript).
Philex Fertich
Philex Fertich 5 месяцев назад
Data-driven подход к обучению: извлечение и визуализация структуры курсов
End-to-end разработка системы сбора и визуализации данных о структуре курсов для формирования учебного графика. Для проекта были использованы следующие инструменты: - Selenium: Эмуляция браузера для взаимодействия с ресурсом. - Pandas: Подготовка данных и сохранение результата. - Seaborn: Декорирование визуализации. - Matplotlib: Настройка и отображение визуализации. В результате получены два скрипта prep.py - для извлечения, подготовки и сохранения данных. И viz.py - для визуализации структуры в виде круговой диаграммы соотношений объемов курсов. На основе данных из диаграммы был сформирован учебный график и распределены соответствующие учебные предметы.
Ivan Gerasimov
Ivan Gerasimov 5 месяцев назад
Парсинг olmi-connect.ru: извлекаем штрихкод EN13 для валидации
✅ Штрихкод EN13 — обязательное поле, которое мы достанем Вы подтвердили: штрихкод есть в карточках каждого товара. Это критически важные данные. Именно по ним скрипты проверки подтвердят качество работы. Парсер настроен на извлечение EN13 из характеристик или скрытых полей страницы — без этого товар не попадёт в финальный JSON. Что получаете на выходе: — Идеально валидный JSON строго по вашему шаблону — 11 обязательных полей: id, name, article, brand, images, measure_unit, params, krat, dimensions (без volume), category, url — Полные характеристики в params, включая штрихкод — Рассчитанные габариты, описание, изображения, цену Ни одного дубля. Гарантирую. Дубль = совпадение бренда + артикула. Но бренды пишут по-разному. Решение: «умный» словарь синонимов. Legrand = LEGRAND, ABB = АББ, OlmiOn = OLMI → единый ключ Источники обрабатываются строго по приоритету. Товар из первого источника блокирует дубль из второго. Результат: Готовый JSON без мусора, без пропусков, с корректными штрихкодами
Philex Fertich
Philex Fertich 5 месяцев назад
Сбор научных данных с эмуляцией пользовательского окружения
Исследование и разработка системы автоматизации сбора научных данных с методами обхода анти-бот систем. Где были использованы следующие инструменты для достижения цели: - SeleniumBase: Эмуляция пользовательского окружения. - BeautifulSoup: Извлечение данных в разметке. - Pandas: Обработка табличных данных и сохранение для дальнейшего их использования. Реализован интерфейс управления командной строки для управления логикой парсинга без вмешательства в исходный код. В результате получены три таблицы в едином excel-файле соответствующие исходным без потери данных.