什么是孤儿页面
孤儿页面(orphan page)指的是站内没有任何可点击内链指向的 URL。它可能还正常打开、内容也完整,但从首页出发沿着导航、列表、正文链接一路走,永远走不到它。对蜘蛛来说,这类页面的进入途径少得可怜,一旦这几条途径断掉,抓取就会慢慢停下来。
需要区分的是:孤儿不等于死链。死链返回 404 或 410,蜘蛛很快会放弃;孤儿页面状态码是 200,只是没人带路,问题更隐蔽,也更容易被忽略。
孤儿页面是怎么产生的
- 改版时下架了某个栏目,页面没删,只是把入口链接去掉了。
- 列表分页只保留最近若干页,旧文章从分页里滑了出去。
- 正文里的互链被替换成新链接,旧 URL 失去了唯一的入口。
- 专题页、活动页到期后从导航里撤掉,但页面文件还留在服务器上。
- 上线测试用的页面忘了加内链,也没进 Sitemap。
- 文章被合并或重写,旧地址没有做跳转,也没有任何页面再引用它。
蜘蛛还有哪些途径能发现它们
内链断了不代表蜘蛛立刻就不来了,以下几种来源仍可能让抓取继续一段时间:
- Sitemap:只要 URL 还在文件里,蜘蛛仍会按 Sitemap 内容来抓,这是最稳定的兜底入口。
- 外部链接:别的站点或社交平台指向过这个地址,蜘蛛顺着外链就能进来。
- 历史抓取记录:蜘蛛见过并抓过这个 URL,短期内可能按重抓间隔再回来,但访问频率会逐步下降。
- 站内搜索、标签页、时间归档:这些动态页面常把所有 URL 又串一遍,但也会带来大量重复入口。
- 提交记录:曾经提交过的地址会在系统里保留一段时间。
这几条途径的稳定性差别很大。Sitemap 和外链属于外部信号,只要还在,蜘蛛就有理由继续来访;历史记录和动态列表则更依赖抓取节奏,站内搜索页还可能因为参数组合太多,把有限的抓取量分散在大量重复 URL 上。
自查:怎么把孤儿页面找出来
不需要复杂工具,几份数据交叉对照就能看出大概:
- 抓取日志与内链清单对照:把日志里被访问过的 URL、站内所有 a 标签指向的 URL 各导一份,差集就是可疑对象。
- Sitemap 与内链清单对照:只出现在 Sitemap、不出现在任何内链里的 URL,属于典型孤儿。
- 看入口页的抓取量走势:某个栏目页的抓取量突然下滑,先检查它的出链是不是被改过。
- 点击深度抽查:随手挑十几个详情页,从首页手动点一遍,走不到的就记下来。
处理顺序建议
找到之后不必全部抢救,按价值排序更实际:
- 有流量或转化价值的页面,补一条稳定内链,放在相关正文或相关栏目里,比放进页脚“最新文章”更持久。
- 确认不再需要的页面,返回 410 或 404,并从 Sitemap 中移除,尽量不要用 noindex 加长期挂着的方式处理。
- 内容仍有价值、但不想单独展示的,合并进主页面并做 301 跳转。
- 确定要长期保留的,保持在 Sitemap 中,同时给它一个不会随改版消失的入口。
孤儿页面的核心问题是“没有入口”,不是“没有被提交”。补内链通常比反复提交 URL 更对症,但两者都不保证一定被重新抓取或收录。
日常怎么避免再产生
改版、删栏目、调整分页是孤儿页面的高发场景。可以在流程里加两个小动作:下架页面时先决定是删还是留,删就设状态码并清理 Sitemap,留就指定一个新的入口;每月把 Sitemap 与内链清单对照一次,差额逐条确认原因。这样做的目的不是追求抓取量增长,而是让站内路径保持连贯,让蜘蛛不必在站点里走进死胡同。