Требуется парсер урлов страниц сайта с веб-архива. Сами документы не нужны, не нужна ни графика ни все остальное.
На входе имеем файл со списком доменов
domain1.com
domain2.com
domain3.com
domain4.com
на выходе один файл с максимально возможным списком страниц этих доменов
domain1.com/page1.html
domain1.com/page2.html
domain1.com/page3.html
domain1.com/page4.html
domain2.com/page1.html
domain2.com/page2.html
domain2.com/page3.html
domain2.com/page4.html
domain3.com/page1.html
domain3.com/page2.html
domain3.com/page3.html
domain4.com/page1.html
domain4.com/page2.html
domain4.com/page3.html
Даже если самих страниц в веб-врхиве нет.
То есть, если в архиве есть только одна страница, и на ней есть ссылки на другие страницы, хотя самих страниц нет, то нужно спарсить ссылки с этой страницы. Если есть другие страницы, то проходим на них и парсим ссылки от туда, соответственно дубли удаляем. Таким образом собираем максимально возможный список страниц.
Скрипт серверный
многопоточный
если вебархив банит, то работа через прокси
должен работать при закрытом браузере
Надеюсь понятно объяснил
Опубликован 17.07.2013 в 17:07