Портфолио и кейсы фрилансеров по парсингу данных

Михаил Огородник
Михаил Огородник 18 часов 42 минуты назад
PriceRadar — система автоматического мониторинга цен конкурентов
Разработал веб-сервис PriceRadar с отдельным frontend, backend и системой фоновых задач. Реализовано: • личный кабинет и авторизация пользователей; • организации и разграничение доступа к данным; • проекты, товары и конкуренты; • привязка URL товаров конкурентов; • автоматическое получение и нормализация цен; • сохранение истории цен; • определение повышения и снижения стоимости; • отображение разницы между собственной ценой и конкурентом; • фоновые проверки через очередь задач; • обработка ошибок и повторные попытки; • импорт и экспорт XLSX; • административная панель; • demo-режим для демонстрации продукта. Для получения данных используется несколько способов извлечения: structured data, microdata, meta-информация и HTML-разбор. Более тяжёлый браузерный режим применяется только там, где обычного HTTP-запроса недостаточно. Отдельное внимание уделено безопасности: изоляции данных организаций, проверке внешних URL и защите от запросов к внутренним адресам. Стек проекта: Next.js, TypeScript, FastAPI, Python, PostgreSQL, Redis, Celery, Docker. Реализован полный цикл: • создание проектов, товаров и конкурентов; • привязка URL товаров конкурентов; • автоматическое получение цен; • сохранение истории изменений; • сравнение собственной цены и цены конкурента; • фиксация повышения и снижения стоимости; • фоновые проверки; • обработка ошибок и повторные попытки; • импорт и экспорт XLSX; • административная часть; • demo-режим.
Игорь Дерябин
Игорь Дерябин 1 день 13 часов назад
AI-анализ тендеров и документов — от файла до готовой сделки
Разрабатывал систему автоматического анализа тендерной и деловой документации. Основная задача — сократить ручной разбор PDF, DOCX, таблиц и карточек закупок и превращать неструктурированные документы в понятный результат для дальнейшей работы. Что может делать такая система: загружать и обрабатывать документы из разных источников; работать с PDF, DOCX, XLSX и текстовыми файлами; извлекать ключевые поля из документов; находить суммы, сроки, требования, реквизиты и ограничения; определять заказчика, регион и категорию закупки; классифицировать документ по заданным правилам; оценивать релевантность тендера; выделять важные условия и риски; присваивать приоритет; создавать структурированную карточку; передавать результат в CRM или внутреннюю систему; сохранять ссылку на исходный документ и подтверждающие фрагменты; вести историю обработки и результаты AI-анализа. Например, вместо того чтобы сотруднику вручную читать десятки страниц документации, система может подготовить карточку: заказчик → сумма → срок подачи → предмет закупки → требования → риски → релевантность → следующий шаг. Технологии: Python, Django / FastAPI, PostgreSQL, REST API, LLM API, обработка PDF/DOCX/XLSX, OCR при необходимости, background jobs, интеграции с CRM. Подобную систему можно использовать не только для тендеров, но и для: договоров; коммерческих предложений; технических заданий; заявок клиентов; спецификаций; счетов и актов; нормативных документов; больших архивов корпоративной документации.
Пётр Сидоров
Пётр Сидоров 2 дня 13 часов назад
Мониторинг лотов Telderi по заданным признакам
Рабочий проект по регулярному мониторингу активных лотов на площадке Telderi. Задача — автоматически обходить каталог, собирать карточки лотов и проверять их описания по заданным текстовым признакам. В рабочем наборе используется 49 признаков; внутри каждого прогона удаляются повторяющиеся URL и отдельно контролируется полнота обхода каталога. Неполный проход не выдаётся за полноценный срез. Сбор реализован на Python через HTTP/JSON без браузерной автоматизации. Карточки обрабатываются параллельно, для сетевых ошибок и ограничений используются повторные запросы с увеличивающейся задержкой. Результат каждого полного запуска — структурированная CSV-выгрузка из 7 полей. Проект использовался для длительного мониторинга: около 17 месяцев работы, 72 сохранённых датированных среза и порядка 2 000 активных лотов в типичном полном срезе. Выгрузки служили источником новых записей для накопительного мониторингового реестра. Результат — автоматизированный процесс регулярного сбора, фильтрации и подготовки данных для дальнейшего анализа.
Пётр Сидоров
Пётр Сидоров 2 дня 14 часов назад
Регулярный мониторинг ассортимента и отзывов M.Video
Рабочий проект по регулярному мониторингу ассортимента и отзывов M.Video. Система периодически собирает данные о товарах, рейтингах, отзывах и ссылках, приводит их к единой структуре и сравнивает новый сбор с ранее накопленной историей. При каждом обновлении выполняется дедупликация: уже сохранённые отзывы не добавляются повторно, а новые записи дополняют историю. Это позволяет получать не разовую выгрузку, а регулярно обновляемый массив данных. В последнем рабочем срезе — 548 товаров и 4 375 отзывов в накопленной истории. За период мониторинга выполнено 15 последовательных выгрузок. Результат — структурированный Excel-файл с актуальным срезом и сохранённой историей изменений, готовый для дальнейшей аналитики.
Пётр Сидоров
Пётр Сидоров 2 дня 15 часов назад
Сбор и нормализация данных из нескольких источников
Реальный проект по регулярному сбору и подготовке данных из нескольких маркетплейсов и интернет-магазинов. Задача — объединить разнородные данные из 8 источников в единую структуру для регулярной аналитической работы. У площадок отличаются названия полей, форматы и способы получения данных, поэтому информация проходит маппинг, очистку, дедупликацию, нормализацию и контроль качества. В единую модель приводятся данные о товарах и отзывах, ссылки, рейтинги, наличие и другие необходимые поля. Данные обновляются регулярно, при этом сохраняется история предыдущих срезов. Результат — стандартизированный набор данных с единым форматом, готовый для дальнейшей аналитики и выгрузки в Excel и другие согласованные форматы.
Никита Бочаров
Никита Бочаров 6 дней 8 часов назад
Парсер tdorion.com — сбор каталога в Excel
Парсер tdorion.com — сбор каталога в Excel ЗАДАЧА Клиенту нужен инструмент для сбора всего каталога оптового поставщика с авторизацией: обход всех категорий, парсинг товаров с характеристиками, изображениями и категориями, наценка и выгрузка в Excel в формате для маркетплейса. РЕШЕНИЕ Разработал многопоточный парсер на Python. Авторизация через API сайта, рекурсивный обход дерева категорий с исключением ненужных, сбор ссылок на товары через пагинацию. Данные о товарах извлекаются из встроенного JSON __NEXT_DATA__ — надёжнее, чем парсить HTML. Реализовал retry-механизм, логирование в файл, прогресс-бар tqdm. Фильтр по цене (от 3000 руб.), наценка 4% с округлением до сотен, экспорт в XLSX с динамическими колонками характеристик. ЧТО РЕАЛИЗОВАНО Авторизация через API сайта Многопоточный обход категорий (ThreadPoolExecutor) Retry-механизм для сетевых ошибок Рекурсивный сбор конечных категорий Парсинг встроенного JSON __NEXT_DATA__ Сбор изображений, характеристик, описаний Фильтрация по цене (от 3000 руб.) Наценка 4% с округлением до сотен Экспорт в Excel с динамическими колонками характеристик Логирование в файл и консоль Прогресс-бар tqdm для отслеживания
Ivan Gerasimov
Ivan Gerasimov 6 дней 14 часов назад
Телеграм бот для Парсинга
Разработка парсера для сбора данных. Основные этапы работы: • Анализ требований и постановка задачи • Исследование источников данных • Разработка архитектуры решения • Реализация основного функционала • Тестирование и отладка • Документирование и развертывание Технический стек: Python, Aiogram, Telegram API, SQLite/PostgreSQL.
Ivan Gerasimov
Ivan Gerasimov 6 дней 14 часов назад
Разработка бэкенда и парсеров на FastAPI
Создать масштабируемый бэкенд на FastAPI с интегрированной системой парсинга данных. Архитектурные решения: • Микросервисная архитектура • REST API с полной документацией (Swagger/OpenAPI) • Асинхронная обработка запросов • Очереди задач (Celery + Redis) • WebSocket для реального времени Модули системы: • Аутентификация и авторизация (JWT) • Управление пользователями и ролями • Система парсинга с планировщиком задач • Хранилище данных (PostgreSQL + MongoDB) • Система логирования и мониторинга • Кэширование (Redis) Интеграции: • Telegram Bot API • Google Sheets API • Ozon/Wildberries API • Базы данных и внешние сервисы
Николай Ребецкий
Николай Ребецкий 10 дней 15 часов назад
Парсинг данных с сайтов в Excel / CSV
Автоматизированный сбор и подготовка структурированных данных с сайтов с последующей выгрузкой результатов в Excel или CSV. Такое решение подходит для задач, где информацию приходится регулярно собирать с большого количества страниц, каталогов, таблиц или карточек товаров и ручное копирование занимает слишком много времени. В рамках задачи могут выполняться: получение данных со страниц сайта; обработка каталогов, списков и таблиц; сбор характеристик товаров и других структурированных полей; проверка полученных данных; очистка лишних значений; нормализация структуры; удаление дублей; объединение результатов; сохранение данных в Excel / CSV; подготовка итоговой таблицы для анализа, отчётов или импорта в другую систему. При необходимости процесс можно дополнить фильтрацией, обработкой нескольких источников, регулярным обновлением и дальнейшей автоматической обработкой собранной информации. Для подобных задач использую Python и подходящие библиотеки в зависимости от структуры сайта и способа получения данных. Результат — структурированный файл с данными вместо большого объёма ручного копирования и проверки.
Кирилл Горяйнов
Кирилл Горяйнов 13 дней 20 часов назад
Отбор заказов на трёх биржах: ИИ читает каждый и отсеивает 97% потока
Задача. Заказы приходят с трёх площадок сотнями в день. Читать их все невозможно, а отбор по ключевым словам смысла не понимает: слово «продажи» одинаково стоит и в нужном заказе, и в спаме. Что сделано. Система собирает заказы по расписанию и отбирает их в две ступени. Первая ступень дешёвая, по ключевым словам, отсекает спам и рефералки. Вторая ступень это языковая модель: она читает заказ целиком и решает, подходит ли он под профиль специалиста. Результат за три недели. Собрано 3 600 заказов, человеку показано 113. То есть 97 процентов потока отсеяно без его участия. По отобранным заказам отправлено 35 откликов, письмо пишется под конкретный заказ, а не по шаблону. Отдельно про безопасность. Перед отправкой письмо проверяется на запреты площадки. За период система задержала 8 писем, поймав в тексте слова, за которые площадки блокируют аккаунт. Спорные заказы модель не отправляет сама, а показывает человеку карточкой с кнопками решения. Работает на сервере круглосуточно, без участия человека.