Как должен работать скрипт:
1 версия:
1) Принимать на вход параметры домен, лимит по количеству страниц краулинга, respect robots.txt
2) Проверять разрешение на индексирование в robots.txt (можно с использование готового фреймворка reppy)
3) Проходить по страницам сайта (пока не достигнут лимит).
4) Сохранять все урлы в таблицу с такими показателями тексты title, h1, h2-h6, количество <p>, количество <img>.
5) Считать Уровень Вложенности урла.
6) Сохранять в CSV файл
2 версия:
7) Считать количество ссылок на УРЛ с других страниц того же сайта и их УВ.
8) Настройки краулинга задержка между запросами (рандом или задано вручную)
3 версия:
9) Добавить мультипоточность
Прошу указывать бюджет и сроки для каждой версии краулера.
Пример файла результата в приложении
Опубликован 04.12.2019 в 13:59