Batchurlscraper как пользоваться
Перейти к содержимому

Batchurlscraper как пользоваться

  • автор:

Batchurlscraper как пользоваться

Представляю вашему вниманию бесплатную программу BatchURLScraper, предназначенную для извлечения данных со страниц сайтов используя XPath, CSS-селекторы, XQuery и RegExp.

  • парсинг и извлечение данных по списку URL
  • гибкая настройка парсинга используя XPath, CSSPath, XQuery и RegExp
  • модуль для тестирования правил парсинга
  • экспорт отчетов в Excel (CSV-формат)

Буду рад любым отзывам и пожеланиям по работе программы.

__________________
Site Analyzer — https://site-analyzer.ru/
СуперМод
IMHO Консультант 2005-2009
Регистрация: 14.08.2002
Адрес: Московская ПЛ, ракетный отс
Сообщения: 14 378

Программе явственно не хватает руковводства по эксплуатации, хотя бы онлайнового.
Несколько примеров построения правил, объяснение что такое «XPath, CSSPath, XQuery и RegExp» в принципе и отсылка к более подробному мануалу по перечисленным технологиям.
Понятно, что практически вся информация ищется в интернете, а программу можно освоить «методом тыка», просто удобнее когда есть хоть какой-то мануал.

__________________
Не засоряйте форум «спасибами»! Для выражения благодарности существуют ПС и репутация! Соблюдайте Правила!
Распространенье наше по планете
Особенно заметно вдалеке:
В общественном парижском туалете
Есть надписи на русском языке

В. Высоцкий

Вышла новая версия бесплатной программы BatchURLScraper

Бесплатная программа BatchURLScraper предназначена для извлечения данных со страниц сайтов при помощи XPath, CSS-селекторов, XQuery и RegExp.

Основные возможности:
  • Парсинг и извлечение данных по списку URL
  • Гибкая настройка парсинга используя XPath, CSSPath, XQuery и RegExp
  • Модуль для тестирования правил парсинга
  • Возможность использования списков Proxy
  • Экспорт отчетов в Excel (CSV-формат)
Отличия от аналогов:
  • Многопоточность и высокая скорость парсинга
  • Портативный формат (работает без установки на ПК или прямо со сменного носителя)
  • Бесплатное распространение

В версии 1.3 расширено число страниц для парсинга с 1000 до 5000 URL, добавлена возможность скрапинга через HTML templates и через внешний и внутренний HTML, а также возможность извлечения данных через атрибуты CSS.

Скачать новую версию программы можно здесь .

Google может продолжать ранжировать страницу после удаления совпадающего контента

Google может продолжать ранжировать страницу после удаления совпадающего контента

Например, при смене названия компании

Анна Бондарь 30 ноября 2020

BatchURLScraper

Программа BatchURLScraper предназначена для извлечения данных со страниц сайтов по списку URL. Доступен парсинг (веб скрейпинг) методами XPath, CSSPath, XQuery, RegExp и HTML templates. BatchURLScraper, парсинг и бесплатное извлечение данных с сайтовНастройка правил извлечения данных Правила извлечения данных через XPath, CSSPath, RegExpТестирование правил Тестирование правилОбщие настройки Настройки скрапера, парсера, список проксиУсловия распространения программы: БЕСПЛАТНО

  • Парсинг и извлечение данных по списку URL
  • Гибкая настройка парсинга используя XPath, CSSPath, XQuery, RegExp и HTML templates
  • Модуль для тестирования правил парсинга
  • Возможность использования списков Proxy
  • Экспорт отчетов в Excel (CSV-формат)

Отличия от аналогов

  • Многопоточность и высокая скорость парсинга
  • Портативный формат (работает без установки на ПК или прямо со сменного носителя)
  • Бесплатное распространение

Поддержи развитие программы!

Если у вас есть желание поддержать развитие программы, вы можете перевести любую сумму одним из удобных для вас способов (занимает менее минуты):

  • на карту Тинькофф: https://www.tinkoff.ru/sl/4t02QgyPQTM
  • на Яндекс.Деньги: https://sobe.ru/na/razrabotka_siteanalyzer
  • на кошелек QIWI: https://my.qiwi.com/Andrei-S1gCnDIzQt

Благодарим за поддержку!

История версий

Программа BatchURLScraper внедрена в SiteAnalyzer в виде отдельного модуля и в текущем виде более развиваться не будет. Подробнее.

Версия 1.4 (build 29), 27.04.2021:

  • исправлено зависание программы, если данные по одному из правил не были найдены

Версия 1.4 (build 28), 25.02.2021:

  • исправлена некорректная работа программы с потоками
  • число ошибок при проверке URL должно стать ощутимо меньше

Версия 1.4 (build 27), 08.12.2020:

  • исправлена ошибка с валидацией HTML-темплейтов
  • оптимизирована работа с регулярными выражениями
  • добавлена возможность неучета повторений при скрейпинге

Версия 1.4 (build 26), 07.12.2020:

  • исправлена проблема с учетом пауз между запросами
  • диапазон пауз между запросами расширен до полутора минут
  • доработан и улучшен перевод программы
  • устранены утечки памяти

Версия 1.3 (build 25), 26.11.2020:

  • расширено число страниц для парсинга с 1000 до 5000 URL
  • добавлена возможность скрапинга через HTML templates
  • добавлена возможность извлечения данных через атрибуты CSS
  • добавлена возможность скрапинга через внешний и внутренний HTML
  • добавлена возможность использования списков Proxy
  • исправлен баг некорректного сохранения User-Agent

Версия 1.2 (build 19), 17.11.2020:

  • добавлен метод скрапинга через XQuery
  • оптимизирован парсинг HTML-кода
  • оптимизирована настройка фильтров для извлечения данных
  • оптимизирована настройка пресетов для парсинга
  • добавлен модуль для тестирования правил парсинга

Версия 1.1 (build 12), 04.11.2020:

  • добавлен многопоточный парсинг и извлечение данных по списку URL (до 10 потоков одновременно)
  • добавлена гибкая настройка фильтров для извлечения данных
  • добавлен экспорт результатов в Excel (CSV)

Версия 1.0 (build 6), 29.10.2020:

  • парсинг и извлечение данных по списку URL
  • использование методов скрапинга через XPath, CSSPath, RegExp
  • сохранение пресетов для парсинга

Минимальные системные требования:
– 500 МГц (рекомендуется: 1 ГГц или выше)
– 1 ГБ RAM (рекомендуется: 2 ГБ или выше)
– Microsoft Windows XP/2003/Vista/7-10
– выход в интернет

Извлечение из HTML-кода URL-адресов с желаемыми анкорами ([GETURLSBYANCHORS])

Макрос извлекает из HTML-кода желаемые адреса ссылок и построчно выводит их в результат (с возможностью вывода анкоров). С помощью макроса [GETURLSBYANCHORS] можно с легкостью парсить, например, URL-адреса страниц форм обратной связи с большого списка сайтов.

[GETURLSBYANCHORS(параметры)]HTML-код, содержащий теги a[/GETURLSBYANCHORS]

[GETURLSBYANCHORS(параметры)]HTML-код, содержащий теги a[/GETURLSBYANCHORS]

Параметры указываются построчно (либо разделяются комбинацией символов ||).
Если в качестве параметров указать символ *, то макрос извлечет все адреса ссылок из HTML-кода:

[GETURLSBYANCHORS(*)]HTML-код, содержащий теги a[/GETURLSBYANCHORS]

[GETURLSBYANCHORS(*)]HTML-код, содержащий теги a[/GETURLSBYANCHORS]

Если добавить [ADDANCHOR] в любое место параметров (добавляется один раз в независимости от количества введенных параметров):

[GETURLSBYANCHORS(*[ADDANCHOR])]HTML-код, содержащий теги a[/GETURLSBYANCHORS]

[GETURLSBYANCHORS(*[ADDANCHOR])]HTML-код, содержащий теги a[/GETURLSBYANCHORS]

То в результате работы макроса к каждому URL будут добавлены их анкоры ссылок (URL||анкор).

Для исключения попадания дублей ссылок в результат (в пределах каждого одного документа), добавьте [NODUP] в любое место параметров (добавляется один раз в независимости от количества введенных параметров):

[GETURLSBYANCHORS(*[ADDANCHOR][NODUP])]HTML-код, содержащий теги a[/GETURLSBYANCHORS]

[GETURLSBYANCHORS(*[ADDANCHOR][NODUP])]HTML-код, содержащий теги a[/GETURLSBYANCHORS]

То в результате работы макроса к каждому URL будут добавлены их анкоры ссылок (URL||анкор).

Если указать следующие параметры:

1 2 3
карта адрес [ADDANCHOR]

карта адрес [ADDANCHOR]

То в результате работы макроса вы можете получить:

http://. ||карта сайта http://. ||адреса компании

http://. ||карта сайта http://. ||адреса компании

Как видим, макрос будет искать вхождения параметров в анкорах ссылок. При наличии одного из вхождений, программа добавит ссылку в результат.

Также в параметрах можно использовать регулярные выражения (http://sbfactory.ru/cd/?p=2332). Для этого добавьте re: в начало соответствующих параметров:

1 2 3
карта re:регулярное выражение адрес

карта re:регулярное выражение адрес

Примечание: Для изменения модификаторов регулярных выражений (возможность включения регистронезависимого режима и прочее), пользуйтесь строкой модификаторов (ctrl+8 -> вкладка “RegExpr”). Например, чтобы включить регистронезависимый режим, используйте такую строку модификаторов: gsrimx.

Рубрики: Новости Теги: Content Downloader, видео, инструкция

Вы можете пропустить до конца и оставить ответ. Pinging в настоящее время не доступны.

Отличная функция – спасибо. А не подскажете, форум на писанину заработает, а то есть вопросы, а поговорить не с кем ��

admin says:

Здравствуйте. Пожалуйста. И вам спасибо на добром слове! Можете обратиться к специалистам по настройке http://sbfactory.ru/?p=3534, они всегда рады общаться. С уважением к вам, Сергей.

Написать комментарий

Наши продукты

  • Content Downloader (парсер)
  • CSVPRO (редактор таблиц)

  • Купить Content Downloader
  • Система помощи Content Downloader
  • Форум поддержки
  • Заказать парсинг сайта
  • Заказать разработку ПО
  • С вопросами о покупке (или другими организационными), вы можете в любое время обращаться по Телефону +7 983 381 3211 или Телеграм @ContentDownloaderX1 (Сергей Владимирович)
  • ♥ Хорошего дня!

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *