Примеры работ и кейсы по направлению «Парсинг данных»

Илья Тришкин
Илья Тришкин 23 часа 56 минут назад
Расширение Chrome: сбор данных с открытых страниц в собственное хранилище
Задача. Часть нужных данных лежит на сайте, куда пускают только после входа, и обычным запросом их не получить. Копировать руками — часы работы и неизбежные ошибки. Решение. Сделал расширение для Chrome (Manifest V3). Оно работает внутри уже открытой страницы: снимает разметку и текст, приводит их к нужной структуре и отправляет на приёмник, а тот складывает данные в базу. Пароли и хранилище браузера расширение не трогает, сессию подставляет сам браузер. Работает оно только на адресах из белого списка, каждое действие пишет в журнал. Результат. Данные, которые раньше переносили руками, собираются одним нажатием. Схему повторил во втором проекте; кода меньше сотни строк, его легко проверить.
Илья Тришкин
Илья Тришкин 1 день назад
Ежедневный конвейер сбора и сверки данных из десятков источников
Задача. Данные приходят от нескольких десятков поставщиков, и каждый шлёт по-своему: у одного своя кодировка, у другого своя структура, у третьего опечатки, повторы и сдвинутое время. Публиковать надо каждый день, и любая пропущенная ошибка в тот же день доходит до конечного пользователя. Решение. Построил конвейер, который принимает файлы, разбирает их в единую структуру, вычищает текст и сверяет с первоисточником. Данные лежат в собственной базе, обработка идёт на сервере. На каждом шаге стоят проверки: разошлось с источником, порвалась последовательность, пришёл дубль — конвейер поднимает сигнал и кладёт запись в отчёт раньше, чем данные уйдут наружу. Результат. Конвейер работает без перерывов с 1999 года, публикация каждый день. Форматы разбираются и проверяются без ручного труда; сам подключаюсь только там, где нужно живое суждение.
vkysni_vata36ru
Фрилансер 3 дня 7 часов назад
vkysni_vata36ru
Фрилансер 10 дней 10 часов назад
Парсинг данных на Python - примеры работ
Сбор информации с сайтов, выгрузка в Excel, написание скриптов под заказ.
sunwait67
Фрилансер 11 дней 5 часов назад
sunwait67
Фрилансер 11 дней 5 часов назад
sunwait67
Фрилансер 11 дней 5 часов назад
автопостинг контента в ВК
Автоматический постинг в группу ВКонтакте: из новостей или твоих материалов — готовый пост с текстом и уникальной картинкой, по расписанию. Что входит: - скрипт-пайплайн: получить ссылку → подготовить пост → сгенерировать картинку (gpt-image-1 через ProxyAPI) → опубликовать через VK API; - отложенный постинг по расписанию (например, по средам) или сразу; - защита от дублей и сбоев (retry при ошибках загрузки ВК); - выгрузка в твою группу, настройка прав токена. Можно адаптировать под Telegram-канал или другой источник новостей. Стек: Python, requests, ProxyAPI, VK API, python-dotenv.
Николай Алымов
Николай Алымов 14 дней 4 часа назад
Автоматический парсинг и сопоставление артикулов
🚀 Ozon Data Pipeline: Автоматизация сбора данных любой сложности Задача: Автоматизировать сбор информации о товарах Ozon по списку артикулов. Главные вызовы: антифрод, динамическая подгрузка характеристик и разный формат написания артикулов. Как проходил процесс? 🔹 Использовал Playwright с управлением сессиями. Это позволило имитировать действия человека, обходить блокировки и корректно подгружать данные через программный скролл и задержки. 🔹 Реализовал локальное кэширование. Скрипт сначала сохраняет страницы на диск, а затем парсер обрабатывает их автономно. Это защищает от банов и позволяет мгновенно менять логику извлечения данных без повторных запросов к сайту. 🔹 Разработал многоуровневую логику сопоставления. Система находит нужный товар, даже если форматы артикулов различаются (точки, тире...), последовательно проверяя партномера, SKU и вхождения в заголовки. Что получили на выходе: ✅ Excel-пакет: Готовый отчет со всеми полями: чистые описания, структурированные характеристики и габариты упаковки. ✅ HQ Контент: Скрипт находит оригиналы фото, очищая ссылки от параметров сжатия Ozon — вы получаете медиа в максимальном качестве. ✅ Надежность: Модульная архитектура делает процесс устойчивым к обрывам связи и изменениям верстки. 🛠 Стек: Python, Playwright, BeautifulSoup4, Pandas. 🚀 Итог: Рутинная работа недель превращена в процесс нескольких минут с гарантированной точностью данных! 📥 Нужен надежный парсер или автоматизация? Пишите — обсудим ваш проект!
Sergei Kolesov
Sergei Kolesov 16 дней 19 часов назад
Мониторинг цен B2B-площадки с обходом антибота
Задача: регулярно собирать тарифы с закрытой B2B-площадки, где стоит защита от ботов. Решение: парсер на Python с эмуляцией браузера, ротацией заголовков и паузами — проходит антибот-защиту и не попадает под блокировки. Сбор идёт по расписанию, результат автоматически выгружается в Excel по нужным полям. Работает стабильно без ручного вмешательства. Стек: Python, Playwright, pandas.
ВБ
Виталий Беляев 17 дней 13 часов назад
Парсер спортивных событий через API с выгрузкой в Excel
Проект разработан для автоматического сбора и подготовки данных о предстоящих футбольных событиях. Задача — заменить ручное копирование информации и получать готовую структурированную таблицу для дальнейшего анализа. Что реализовано: — загрузка событий через API с обработкой страниц; — отбор матчей на ближайшие 12 часов; — получение основных и дополнительных рынков; — очистка и нормализация названий и значений; — преобразование данных в формат «один матч — одна строка»; — выгрузка результатов в CSV для открытия в Excel; — отдельное сохранение подробной таблицы по всем рынкам. В контрольной выгрузке 40 основных событий были преобразованы в таблицу из 27 полей. Дополнительная таблица содержит более 6700 строк с детализированными данными. Парсер обрабатывает пустые значения, статусы событий и время начала матчей. Структуру итоговой таблицы можно изменить под требования заказчика.