数据提取
数据提取会读取域名集中每个网站的页面,并取出与表达式匹配的部分。一个网站集合由此变成一张表格:电话号码、社交账号、地址、插件名称,凡是模式能捕获的内容都可以。
读取哪些内容
PublicWWW 为这些网站收录的全部内容,包括内页,而不仅是搜索时匹配到的首页。即使某个联系方式只出现在“关于我们”页面上,也同样能被找到。
预设与自定义模式
系统为最常用的需求(邮箱地址、电话号码)提供了预设,您也可以改用任意正则表达式。表达式的用法与搜索中的 snipexp: 相同:写入结果列的是捕获组的内容,没有捕获组的表达式只会得到空结果。
|/wp-content/plugins/([\w\d\-\.\_]+)/|
请先在小型域名集上测试。您可以限制提取的记录数,反复尝试、调整表达式,这样即使模式写错,代价也几乎为零。这一点为何重要,请参阅限制。
导出结果
提取出的表格可以下载为文件,并用电子表格软件打开。每一行是一个网站及在其中找到的内容;没有任何匹配的网站也会列出,这样缺失之处一目了然,而不会被悄悄略去。
用域名集筛选搜索结果
域名集也可以反过来用作筛选条件。上传您自己的域名、URL 或邮箱地址列表,即可将搜索结果限定为该列表中的网站;或者通过差集运算,排除这些网站。
提取电话和邮箱完整演示了整个流程,从两次搜索一直到生成电子表格。
下一篇 限制