Требуется написать парсер форума на базе Vbulletin (приоритетно) на скриптовом языке (PHP, python), который бы:
1) проходил авторизацию (на входе логин:пароль)
2) выкачивал только (!) текст темы и связанные с ней посты, авторов сообщений и их данные полей (только текст, без тегов)
3) по возможности оставлять ссылки и изображения
4) имел функцию подкачки новых постов для архивации
Скорость не важна, почему можно делать это медленно, чтобы не натыкаться на CAPTCHA, либо использовать API сторонних сервисов по дешифровке графических фильтров. Теги HTML требуется урезать.
Опубликован 23.12.2013 в 19:17