动手排查百度爬虫之前,最该准备的不是服务器权限,而是一份能对上号的日志样本和一份入口清单。很多人一上来就改robots.txt或加站点地图,结果连百度爬虫是否真的来过、抓的是哪个域名都没确认,改了也判断不出效果。准备工作的核心是让每一次抓取都能被定位到具体URL、具体时间、具体状态码。
不少人把robots.txt里的Disallow当成“让百度删掉这个页面”的手段,于是排查前只准备这一份文件。实际含义不同:robots.txt限制的是爬虫抓取行为,不保证已收录内容从索引中移除。因此检查前需要准备的信息要分成两类——一类证明爬虫来过没有,一类证明页面当前是否允许被抓。只有两类信息齐全,才能判断某个URL“不收录”是抓取问题、索引问题还是内容问题。
准备一份覆盖最近一段时间的Web访问日志,建议至少包含完整User-Agent、请求时间、请求URL、HTTP状态码和响应字节数。判断百度爬虫时,用User-Agent里的标识做筛选,例如包含 Baiduspider 的记录,而不是只看IP。原因是IP段可能变化,User-Agent是更直接的线索。
检查项与判断结果:
注意:日志里出现疑似百度爬虫的User-Agent,不能单独证明身份,因为该字段可被伪造。需要结合反向解析等可核对手段,但不要把它当成唯一判据。
准备一份站点主要入口的URL列表,包括首页、栏目页、重要内容页,以及你怀疑有问题的页面。对每个URL记录:当前是否可正常访问、返回状态码、是否被robots.txt规则覆盖、是否在站点地图中。这里要分清两件事——站点地图提交不保证收录,它只是提供发现线索;HTTPS也不保证安全无漏洞或排名提升,它只是传输层配置。
一个可执行的核对步骤:
适用条件:这套步骤适合URL数量可控、需要人工定位的站点。如果URL规模很大,先按目录或模板抽样,而不是逐条处理。
如果只能安排最少的工作,优先准备:一份可按User-Agent筛选的日志样本、一份包含状态码的入口URL清单、一份当前生效的robots.txt内容。这三样能回答“百度爬虫来没来、抓了什么、允许抓什么”,是后续任何调整的判断基础。缺少其中任何一项,改动都容易变成猜测。
下一步:从日志中筛出最近一周的百度爬虫记录,按状态码分组统计,把非200的URL单独列出来,作为第一轮核查对象。