跳到主要内容

常见问题

关于收录​

为什么搜索结果里会有我的站?​

两种情况:一是页面被别处链到,顺着链接找过来的;二是站点自己的 sitemap.xml 或首页把它列出来了。只要页面是公开可访问的,就可能被收录 —— 收录不需要你同意,也不需要你提交,跟其它搜索引擎一样。

我只搜到一条「无法获取页面标题及内容」,那是什么?​

那是占位记录。你站挡住了我们(robots 屏蔽,或者 Cloudflare 之类的验证质询过不去),标题和内容我们读不到,就只留一条说明告诉搜索的人「这个站在那儿」。它不代表我们抓到了什么,也不影响你站的正常显示。

为什么我的页面没有被收录?​

常见原因:页面写了 noindex;robots.txt 挡了;需要登录才能看;纯前端渲染、抓不到正文;或者我们还没抓到它。逐条对照抓取规则看看。

我怎么知道你们收了多少页?​

在搜索框里输入 site:你的域名,比如 site:example.com,会列出这个站已收录的页面。

关于内容与更新​

收录多久更新一次?​

页面内容改了,下次抓到时就会更新。我们按内容判断有没有变过,没变的页面不重复入库。所以改完内容不用特意做什么,等我们下次访问就行;想让它快一点,发邮件到 [email protected] 说一声。

结果里那段摘要是从哪来的?​

优先用页面的 meta description,没有就取正文开头那一段里跟查询词相关的部分。所以写好 meta description 对展示效果有帮助。

你们执行 JavaScript 吗?​

不执行,只读服务器直接返回的 HTML。纯前端渲染的页面,我们只能拿到页面标题和 meta description。想让内容被搜到,服务端渲染或预渲染是最稳的做法。

收录正文为什么只有前 2000 字?​

这是索引体积和检索范围的折中:每个页面只留足够判断「这页在讲什么」的那部分。绝大多数页面的主题词都出现在开头,长文中段的具体词我们搜不到。

关于抓取本身​

会不会拖慢我的站?​

同一个域名两次请求之间至少隔 2 秒,同一时间只有一个请求在发,并且遵守你 robots.txt 里的 Crawl-delay。请求从独立的出站地址发出,不跟本站其它业务共用出口。

你们会反复爬同一个页面吗?​

会重新访问,但不会重复保存:内容没变就不更新索引,也支持 ETag / Last-Modified 这类条件请求 —— 没变的话服务器只回一个 304,不重传页面。

被限速了你们会怎样?​

收到 429 或 5xx 会退避重试,响应里带 Retry-After 就按它说的等。人机验证(要跑 JS 的质询)我们过不去,也不会反复试。

联系​

CaelLabSearch 由虚舟实验室(CaelLab)运营。要删收录、改站名、报问题,或者有别的疑问,发邮件到 [email protected];认为自己的权利受到侵害的,发到 [email protected]。