跳到主要内容

概述

CaelLabSearch 是虚舟实验室自建的互联网搜索引擎:自己抓网页、自己建索引,不套现成搜索服务的壳。搜索页面在 caellab.click。

这套文档讲它是怎么工作的 —— 从一个网页被我们发现,到它出现在搜索结果里的那个位置。分三块:

这一块讲什么
它是怎么工作的抓取、抽取、索引、排序,以及安全搜索挡什么
我们的爬虫CaelLabSearchSpider 是谁、遵守什么、怎么让它别来
站长必读怎么被收录、怎么删掉已经收录的内容
想立刻自查一下收录情况

在搜索框里输入 site:你的域名(比如 site:example.com),就能看到这个站已经被收录了哪些页面。

我们公开什么​

搜索的规则越不透明,站长越难把事做对。所以这套文档尽量把能说的都说清楚:

  • 抓取 —— 从哪里开始、多久抓一次、认哪些声明、不做什么,见抓取规则;
  • 内容 —— 一个页面我们留下哪些部分、留多少,见它是怎么工作的;
  • 排序 —— 结果按哪些方面定次序,见结果是怎么排出来的;
  • 安全搜索 —— 四档分别挡什么,见安全搜索;
  • 联系 —— 删收录、改站名、报问题,各发哪个邮箱,见站长必读。

我们不说的​

具体阈值和常数不公开。比如一个站最多在一次结果里出现几条、防滥用留了多少余量 —— 这些数字是用来防着被人钻空子的,写出来等于附一份说明书。

还有几件事写在明处:不卖排名、没有广告位、不接受付费收录。结果里出现什么,只由排序规则决定。