批量页面出现收录异常时,不要逐条打开检查。正确做法是先把问题按“可观测现象”分层,再从每层里按比例抽取少量样本,用抓取、索引、展示三类信号交叉判断,最后只对确认的共性问题批量处理。抽样不是随便挑几条,而是让样本覆盖不同模板、不同目录深度和不同发布时间,这样定位到的原因才有代表性。
“没被收录”是笼统说法,实际至少分三种:一是搜索引擎根本没抓取,二是抓取了但没进索引,三是进了索引但拿不到展示。三者的排查入口完全不同。抽样前先给批量页面打标签,比如从站点地图、日志或站长工具里导出状态,按“未抓取”“已抓取未索引”“已索引无展现”分组。每组各抽 5 到 10 条,不要只抽首页或最热页面,否则样本会偏向已经正常的页面。
随机抽样适合问题范围还不清楚、页面之间差异不大的情况。做法是把待查 URL 放进表格,随机取 10 条,逐条记录抓取状态、canonical、robots 限制、返回码和内容是否与目标一致。代价是样本可能集中在同一模板,如果问题只出在某个目录,随机抽样容易漏掉。
分层抽样适合已知站点有多个模板或栏目。先按模板、目录、发布时间分层,每层抽 2 到 3 条,再对比层与层之间的差异。代价是准备工作更多,需要先整理 URL 结构。判断标准很简单:如果站点结构单一、页面由同一系统生成,用随机抽样;如果存在列表页、详情页、聚合页等多种类型,用分层抽样。
robots.txt 是否误屏蔽了整段目录。注意抓取限制不等于可靠的索引移除,被屏蔽的页面仍可能以其他方式出现在结果里。<meta name="robots"> 是否写了 noindex,以及是否被模板统一注入。把每项检查结果记成“通过 / 不通过 / 不确定”。不通过项在多个样本里重复出现,才可能是共性问题;只在一两个样本里出现,先当成个案。
如果 10 条样本里有 7 条以上卡在同一环节,比如都返回 200 但都未被抓取,可以先检查该目录是否被 robots 限制、内链是否可达、站点地图是否遗漏。如果样本结果分散,说明问题不在单一模板,应回到分层阶段,把层分得更细再抽一轮。对于 HTTPS,它只是传输层条件,不保证页面安全无漏洞,也不保证排名,不要把它当作收录问题的唯一解释。
处理批量问题时,先修影响面最大的共性问题,再对剩余个案单独复查。修改后重新抽同一层的样本,对比修改前后的抓取和索引状态。不同搜索引擎对 robots、canonical、站点地图的支持和响应速度需要分别核查,不要用一家的结果推断另一家。
下一步:从你的待查 URL 表里按模板或目录分三组,每组抽 3 条,填一张包含返回码、robots、canonical、站点地图四项的检查表,先找出重复出现的不通过项。