Витягування даних
Витягування даних читає сторінки кожного сайту в кластері й вибирає з них частини, що відповідають виразу. Кластер сайтів перетворюється на таблицю номерів телефонів, акаунтів у соцмережах, адрес, назв плагінів - усього, що захоплює шаблон.
Що читається
Усе, що PublicWWW проіндексував для цих сайтів, включно з внутрішніми сторінками, - а не лише головна сторінка, на якій спрацював пошук. Контакт, який є лише на сторінці «Про нас», однаково знайдеться.
Готові шаблони й власні вирази
Є готові шаблони для того, що потрібно найчастіше, - email-адрес і номерів
телефонів, - а замість них можна використати будь-який регулярний вираз.
Вираз працює так само, як snipexp:
у пошуку: у колонку потрапляє те, що захопила група захоплення, а
вираз без неї дає порожні результати.
|/wp-content/plugins/([\w\d\-\.\_]+)/|
Спершу перевірте вираз на невеликому кластері. Його можна випробувати, підправити й випробувати знову, обмеживши кількість записів, які витягуються, тож помилковий шаблон майже нічого не коштує - чому це важливо, див. ліміти.
Як отримати результат
Витягнуту таблицю можна завантажити файлом і відкрити в електронній таблиці. Кожен рядок - це сайт і те, що на ньому знайдено; сайт, на якому збігів немає, теж є в списку, тож прогалини видно, а не приховано.
Фільтрування пошуку кластером
Кластер працює як фільтр і в зворотному напрямку. Вивантажте на сайт власний список доменів, URL-адрес або email-адрес і використайте його, щоб звузити результати пошуку до сайтів із цього списку - або, відніманням, до всіх, крім них.
У прикладі витягування телефонів та email-адрес увесь процес розібрано від двох пошуків до електронної таблиці.
Далі Ліміти