🚀 Ozon Data Pipeline: Автоматизация сбора данных любой сложности
Задача: Автоматизировать сбор информации о товарах Ozon по списку артикулов. Главные вызовы: антифрод, динамическая подгрузка характеристик и разный формат написания артикулов.
Как проходил процесс?
🔹 Использовал Playwright с управлением сессиями. Это позволило имитировать действия человека, обходить блокировки и корректно подгружать данные через программный скролл и задержки.
🔹 Реализовал локальное кэширование. Скрипт сначала сохраняет страницы на диск, а затем парсер обрабатывает их автономно. Это защищает от банов и позволяет мгновенно менять логику извлечения данных без повторных запросов к сайту.
🔹 Разработал многоуровневую логику сопоставления. Система находит нужный товар, даже если форматы артикулов различаются (точки, тире...), последовательно проверяя партномера, SKU и вхождения в заголовки.
Что получили на выходе:
✅ Excel-пакет: Готовый отчет со всеми полями: чистые описания, структурированные характеристики и габариты упаковки.
✅ HQ Контент: Скрипт находит оригиналы фото, очищая ссылки от параметров сжатия Ozon — вы получаете медиа в максимальном качестве.
✅ Надежность: Модульная архитектура делает процесс устойчивым к обрывам связи и изменениям верстки.
🛠 Стек: Python, Playwright, BeautifulSoup4, Pandas.
🚀 Итог: Рутинная работа недель превращена в процесс нескольких минут с
гарантированной точностью данных!
📥 Нужен надежный парсер или автоматизация? Пишите — обсудим ваш проект!
https://github.com/nickalymov/ozon-data-pipeline