上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终收录的是你希望展示的版本。多人协作时,不要只靠口头确认,应把配置写成可检查的交付项,由执行人自检、负责人复核,验收通过后再发布。
博客上线不是把文章发出去就结束。与抓取和索引相关的交付物至少包括:
noindex 排除。这些资料的作用是让接手的人不用猜。谁改了规则、为什么改、影响哪些页面,都能追溯到具体条目。
抓取配置主要检查爬虫是否被允许访问页面。执行时可以按下面顺序核对:
robots.txt,确认没有误写全站禁止抓取。如果出现 Disallow: /,除刻意屏蔽整站外,应视为高风险项。robots.txt,确认返回正常内容,而不是错误页或登录页。判断结果时要注意:robots.txt 只控制抓取,不控制索引。一个页面被禁止抓取,仍可能因为外部链接而被索引,只是搜索引擎看不到页面内容。因此不要把 robots.txt 当成删除收录的工具。
索引配置决定页面是否允许出现在搜索结果中。逐项检查:
noindex 标记。noindex,而不是放任自流。<head> 中的 <meta name="robots"> 是否与预期一致。X-Robots-Tag,它同样能控制索引,容易被忽略。多人协作时,最容易出问题的是模板层和页面层冲突。例如模板统一加了 noindex,个别文章又没覆盖,结果整批文章都不被收录。验收时应至少抽查三类页面:一篇普通文章、一个栏目页、一个不希望被收录的标签页。
同一篇博客文章可能通过带 www 和不带 www、带斜杠和不带斜杠、带参数和不带参数等多种网址访问。上线前应确认:
canonical 标签指向主网址,而不是指向自身以外的错误地址。noindex 的页面。假设一篇文章同时能通过 /post/1 和 /post/1?ref=home 访问,如果两者都返回正常内容且没有规范标记,搜索引擎可能分别处理。此时应把带参数版本跳转或标注规范网址,避免同一内容分散。
把任务拆到人,验收才有依据。可以参考下面的分工:
noindex。robots.txt、跳转规则、canonical、站点地图按配置生效。验收通过的判断标准是:希望收录的页面可被抓取、允许索引、规范网址唯一;不希望收录的页面有明确排除手段;站点地图与页面清单一致。任何一项对不上,就先修复再上线,不要等到发布后再回头补。
下一步可以做一次上线前检查表,把上述条目变成勾选项,由执行人和复核人分别签字或记录,交付时随配置说明一起归档。