上线前核对抓取与索引配置,核心是做两件事:先确认搜索引擎能顺利抓到页面,再确认你希望被收录的页面没有被错误地挡在索引之外。最关键的判断依据不是“看起来正常”,而是用抓取工具和索引状态逐项验证。下面按准备、实施、验证、维护四个阶段展开,并给出两种常见处理方案的适用条件。
博客网站的页面类型通常包括首页、文章页、分类页、标签页、作者页、归档页和搜索参数页。上线前先列一张清单,给每类页面标注“希望收录”或“不希望收录”。
这一步决定后面用哪种方式拦截。拦截手段选错,是上线后最常见的问题来源。
阻止抓取和阻止索引是两件事,对应两种不同工具。
方案一:用 robots.txt 的 Disallow 阻止抓取。适用条件是页面不需要被抓取,也不需要出现在索引里。例如后台路径、临时测试目录。判断结果:抓取工具显示“已被 robots.txt 阻止”,页面不会进入正常索引流程。注意,被 Disallow 的页面如果已被外部链接指向,仍可能以无摘要形式出现在结果里,因为它没被抓取,就无法读取页面上的 noindex。
方案二:用页面的 <meta name="robots" content="noindex"> 阻止索引。适用条件是页面可以被抓取,但你不希望它被收录。例如内容单薄的标签页。判断结果:抓取工具能正常获取页面,页面源码中读到 noindex,索引状态显示为“已排除”。
关键区别:如果同时用 Disallow 和 noindex,爬虫被挡在门外,读不到 noindex,页面反而可能因外链留在索引中。所以需要“可抓取但排除索引”时,只用 noindex,不要用 Disallow。这是上线前最容易配错的一步。
配置写完不等于生效,必须实际验证。
验证时区分“可能原因”和“已定位原因”。例如某文章未被收录,可能原因包括:被 noindex、被 canonical 指向别处、内容与已有页面高度重复、外链不足。只有逐项检查后,才能确定是哪一项,不要凭单一现象下结论。
上线不是终点。模板改动、插件更新、批量发布都可能把 noindex 或 canonical 带进不该出现的页面。建议固定周期复查:站点地图中的网址数量是否异常变化,索引状态是否出现大面积“已排除”,robots.txt 是否被误改。
对博客网站建设来说,抓取与索引配置的下一步是:把上面这份检查清单落到一次真实的上线前测试中,对首页、一篇新文章、一个分类页、一个标签页分别跑一遍抓取测试,记录每项的实际结果,再决定是否需要调整拦截方案。