跳到主要内容

CaelLabSearchSpider

你在服务器日志里看到 CaelLabSearchSpider,那就是 CaelLabSearch 抓取网页用的爬虫。这一页说明它是谁、遵守什么,以及怎么让它别来。

身份​

项目值
用户代理(UA)Mozilla/5.0 (compatible; CaelLabSearchSpider/1.0; +https://caellab.click/howsearchworks/crawler/)
robots.txt 里的名字CaelLabSearchSpider
说明页https://caellab.click/howsearchworks/crawler/(就是这一页)
出站地址独立 IP,不与本站其它业务共用出口

上面那串 UA 里,compatible; 后面那一段才是我们在 robots.txt 里认的名字。Mozilla/5.0 是所有爬虫都带的历史习惯写法,不是我们的标识。

看到旧地址不用奇怪

2026-09-27 之前 UA 末尾写的是 https://caellab.click/bot。那个地址永久跳转到这一页,所以更早的日志里出现的旧链接不会失效。

它遵守什么​

  • robots.txt,包括其中的 Crawl-delay。
  • 同一个域名两次请求之间至少间隔 2 秒;站方写了 Crawl-delay 就按更大的那个来(最长 30 秒)。
  • 页面自己的声明:noindex 的页面不收录,nofollow 的页面不跟链接。
  • 服务器繁忙时退避重试,响应里带 Retry-After 就按它说的等。

它不做什么​

  • 不抓需要登录才能看的内容:不带登录态、不带 cookie,不提交任何表单。
  • 不执行 JavaScript,不硬闯人机验证。
  • 不对外提供抓到的正文全文。

不想被我们抓​

在站点根目录的 robots.txt 里加上这一段就行,我们下一次访问前会读到:

User-agent: CaelLabSearchSpider
Disallow: /

只想挡一部分目录、或者只是想让我们慢一点,见屏蔽与移除。已经收录的内容不会因为这一句自动消失,那份说明里也讲了怎么处理。