CaelLabSearchSpider
你在服务器日志里看到 CaelLabSearchSpider,那就是 CaelLabSearch 抓取网页用的爬虫。这一页说明它是谁、遵守什么,以及怎么让它别来。
身份
| 项目 | 值 |
|---|---|
| 用户代理(UA) | Mozilla/5.0 (compatible; CaelLabSearchSpider/1.0; +https://caellab.click/howsearchworks/crawler/) |
| robots.txt 里的名字 | CaelLabSearchSpider |
| 说明页 | https://caellab.click/howsearchworks/crawler/(就是这一页) |
| 出站地址 | 独立 IP,不与本站其它业务共用出口 |
上面那串 UA 里,compatible; 后面那一段才是我们在 robots.txt 里认的名字。Mozilla/5.0 是所有爬虫都带的历史习惯 写法,不是我们的标识。
看到旧地址不用奇怪
2026-09-27 之前 UA 末尾写的是 https://caellab.click/bot。那个地址永久跳转到这一页,所以更早的日志里出现的旧链接不会失效。
它遵守什么
robots.txt,包括其中的Crawl-delay。- 同一个域名两次请求之间至少间隔 2 秒;站方写了
Crawl-delay就按更大的那个来(最长 30 秒)。 - 页面自己的声明:
noindex的页面不收录,nofollow的页面不跟链接。 - 服务器繁忙时退避重试,响应里带
Retry-After就按它说的等。
它不做什么
- 不抓需要登录才能看的内容:不带登录态、不带 cookie,不提交任何表单。
- 不执行 JavaScript,不硬闯人机验证。
- 不对外提供抓到的正文全文。
不想被我们抓
在站点根目录的 robots.txt 里加上这一段就行,我们下一次访问前会读到:
User-agent: CaelLabSearchSpider
Disallow: /
只想挡一部分目录、或者只是想让我们慢一点,见屏蔽与移除。已经收录的内容不会因为这一句自动消失,那份说明里也讲了怎么处理。