跳到主要内容

屏蔽与移除

想让我们别抓,或者把已经收进去的内容删掉,按下面的来。

用 robots.txt 整站屏蔽​

在站点根目录的 robots.txt 里加上这一段,我们下一次访问前会读到:

User-agent: CaelLabSearchSpider
Disallow: /

只挡一部分目录,或者只是想让我们慢一点​

User-agent: CaelLabSearchSpider
Disallow: /private/
Disallow: /search
Crawl-delay: 10

Crawl-delay 的单位是秒。我们取它和默认的 2 秒里更长的那个(最长 30 秒)。

几条规则要写在同一个 User-agent 分组里 —— robots.txt 是「命中哪一组就只按那一组算」,不跟别的组合并,写到别处等于没写。

只挡住某几个页面​

不想动 robots.txt 的话,在页面里加一条就行(放响应头也一样):

<meta name="robots" content="noindex,nofollow">

noindex 是不收录这一页,nofollow 是不跟这一页上的链接,可以只写其中一个。

屏蔽之后,已经收录的内容怎么办​

robots.txt 管的是「以后别抓」:我们不再读取你的内容,但索引里已有的条目不会因此自动消失,它的标题和摘要可能还留着。要真正删掉,看下一节。

另外,如果一个站整体被挡住(robots 屏蔽,或者验证质询过不去),结果里可能还会剩一条只有域名的记录,写着「由于网站的 robots.txt 等设置,无法获取页面标题及内容」—— 那是一条给搜索用户看的说明,不是我们把内容偷偷留下来了。

删除已经收录的内容​

要删除收录、改站名或图标,或者对这个爬虫有别的疑问,发邮件到 [email protected]。

如果你认为自己的权利受到侵害(著作权、商标这类),请发到 [email protected],我们会优先处理。

为了能准确定位,麻烦一并说明:

  • 要处理的域名,或者具体的页面地址;
  • 是想整站不再收录、只删某几条,还是只更新一下站名和图标。

想让我们收录或更新某个页面​

同样发邮件到 [email protected] 并说明具体地址就行。正常情况下我们自己会抓到,找我们只是让它快一点。

想知道我们已经收了你多少页​

在搜索框里输入 site:你的域名(比如 site:example.com)就能看到这个站已收录的页面,这也是最直接的核对方式。