上线前核对抓取与索引配置,核心不是“让搜索引擎立刻收录”,而是确认三件事:页面能被正常抓取、页面愿意被索引、最终呈现的规范化地址符合预期。常见误解是“文件上传成功、页面能打开,就等于搜索引擎会收录”。实际上,服务器返回状态、robots 规则、页面级指令、规范化标签、站点地图和渲染方式都会影响结果,任何一环配置冲突都可能让页面抓不到或不被索引。多人协作时,最稳妥的做法是把这些检查项写进交付清单,由开发、内容和运维各自确认,而不是上线后再凭搜索结果反推。
抓取指搜索引擎爬虫能否请求并获取页面内容;索引指获取内容后,是否把它纳入可被检索的数据库。页面被抓取不等于会被索引,被索引也不等于会有理想排名。上线前核对时,应分别检查这两层,不要把“服务器日志里有爬虫记录”当成“页面一定已收录”。
多人协作中最容易出现的误解是:开发认为能返回 200 就算完成,内容方认为页面写好了就该被搜到。比较清晰的交付方式是让开发确认可抓取性,让内容或 SEO 负责人确认可索引性和规范化设置,最后由测试人员按同一份清单复核。
抓取侧的目标是排除阻碍爬虫访问的因素。以下检查项可以直接执行:
/robots.txt 打开,逐条看 Disallow 路径是否覆盖了上线页面。注意:Disallow 只影响抓取,不等于页面一定不会出现在结果里,但会显著影响正常收录。判断结果时要注意条件:如果页面需要登录才能访问,公开抓取本身就不适用;如果页面是用户个人中心或订单结果页,通常不应期望被索引。此类页面应把重点放在阻止索引,而不是强行让爬虫抓取。
索引侧主要看页面是否主动或被动地拒绝索引,以及多个地址是否指向同一个规范版本。常见检查项包括:
<meta name="robots">。若出现 noindex,页面即使被抓取也不会进入索引。上线前应确认这是有意设置,而不是模板默认带出。X-Robots-Tag。它和页面 meta 指令作用类似,但由服务器返回,容易被忽略。若响应头写了 noindex,页面里的 index 不能覆盖它。<link rel="canonical"> 是否指向本页规范地址。若多个 URL 展示同一内容,规范化应统一到一个首选地址。canonical 是提示而非强制指令,但配置混乱会增加重复版本被分别处理的机会。这里有一个常见冲突:模板为了统一安全策略,在响应头加了 noindex,而内容人员只在页面 meta 里写了 index。最终以响应头为准,页面不会进入索引。多人协作时,应把响应头配置纳入开发交付项,而不是只检查 HTML。
上线前建议按下面顺序核对,并把结果记录在交付单中:
假设某团队上线一批活动页,开发在测试环境给全站加了 X-Robots-Tag: noindex,上线时忘记移除。页面能正常打开,内链和站点地图也正常,但索引侧会被整体拒绝。这个例子说明:抓取检查通过,不代表索引检查通过。适用条件是页面确实希望被公开索引;如果活动页只面向已登录用户,则应保留 noindex,并改为检查登录和权限配置。
上线后不要只看网页搜索结果。更可靠的做法是查看服务器日志中目标 URL 的爬虫请求状态,确认返回码和请求频率;同时用搜索引擎官方提供的网址检查或抓取测试类工具提交单个 URL,观察它报告的抓取状态、规范地址和索引状态。不同搜索引擎的工具和反馈周期不同,不能把某一个平台的显示结果当成所有搜索引擎的结论。
如果发现页面长期未被索引,先按“抓取是否成功、是否被指令拒绝、是否有规范冲突、是否有可用内链”四项排查,而不是直接反复提交站点地图。下一步可以从本次上线清单中挑一个最关键页面,完整走一遍上述检查,把结果写成可复用的交付记录,再推广到其余页面。