Витягування даних

Витягування даних читає сторінки кожного сайту в кластері й вибирає з них частини, що відповідають виразу. Кластер сайтів перетворюється на таблицю номерів телефонів, акаунтів у соцмережах, адрес, назв плагінів - усього, що захоплює шаблон.

Що читається

Усе, що PublicWWW проіндексував для цих сайтів, включно з внутрішніми сторінками, - а не лише головна сторінка, на якій спрацював пошук. Контакт, який є лише на сторінці «Про нас», однаково знайдеться.

Готові шаблони й власні вирази

Є готові шаблони для того, що потрібно найчастіше, - email-адрес і номерів телефонів, - а замість них можна використати будь-який регулярний вираз. Вираз працює так само, як snipexp: у пошуку: у колонку потрапляє те, що захопила група захоплення, а вираз без неї дає порожні результати.

|/wp-content/plugins/([\w\d\-\.\_]+)/|

Спершу перевірте вираз на невеликому кластері. Його можна випробувати, підправити й випробувати знову, обмеживши кількість записів, які витягуються, тож помилковий шаблон майже нічого не коштує - чому це важливо, див. ліміти.

Як отримати результат

Витягнуту таблицю можна завантажити файлом і відкрити в електронній таблиці. Кожен рядок - це сайт і те, що на ньому знайдено; сайт, на якому збігів немає, теж є в списку, тож прогалини видно, а не приховано.

Фільтрування пошуку кластером

Кластер працює як фільтр і в зворотному напрямку. Вивантажте на сайт власний список доменів, URL-адрес або email-адрес і використайте його, щоб звузити результати пошуку до сайтів із цього списку - або, відніманням, до всіх, крім них.

У прикладі витягування телефонів та email-адрес увесь процес розібрано від двох пошуків до електронної таблиці.

Далі Ліміти