什么算孤儿页面
孤儿页面指的是站内没有任何链接指向它的 URL。它可能存在,也可能有内容,但用户和蜘蛛都只能通过外部链接、sitemap 或手动提交的地址才能到达。对搜索引擎来说,这类 URL 缺少上下文,既不知道它和哪些页面相关,也很难判断它该隔多久回访一次。
常见的孤儿页面包括:早期做活动留下的落地页、测试环境误发布到线上的目录、批量生成的商品或文章页、被下架但没删除的旧地址,以及改了导航之后忘了补链接的老栏目。
蜘蛛发现 URL 的几条路径
- 站内链接:从首页、栏目页、正文里的链接一层层爬过去,这是最主要也最持续的路径。
- sitemap:相当于一份提交清单,蜘蛛会定期读取,但读到不代表马上抓,也不代表会收录。
- 外部链接:别的站点链过来,蜘蛛顺着爬进来,通常只对被发现那一次起作用。
- 手动提交或 URL 检查工具:适合新页面第一次曝光,量小,不能当日常手段。
- 历史记录:以前抓取过的 URL,会按一定的回访节奏再来看,间隔通常比内链页面长。
这几条路径里,只有内链是稳定、可预期、能反复触发的。其他方式更像一次性投递。
孤儿页面为什么容易被落下
抓取资源是有限的。蜘蛛在一个站上花的时间,会优先分配给入口清晰、被多次链接、历史表现稳定的页面。一个没有内链的 URL,既不在主要路径上,也没有来自其他页面的关联信号,自然排在后面。
结果往往是:提交之后很长时间没有动静,或者抓了一次就很少再来。内容更新了也难以及时被抓到,收录状态自然不稳定。
怎么找出站内的孤儿页面
- 用爬虫工具整站抓一遍,把抓取到的 URL 列表和 sitemap 里的 URL 列表做差集,只在 sitemap 里出现、爬虫爬不到的那些基本就是孤儿。
- 看服务器日志,筛选出有抓取记录但站内找不到入口的地址,这类通常是外部链接带进来的。
- 在站内搜索里搜几个只属于该页面的关键词,如果站内都搜不到,说明它没有被纳入任何聚合或列表。
- 检查栏目页和列表页的分页,很多内容其实是卡在第 3 页之后没人点,逐渐变成事实上的孤儿。
处理方式
- 值得留的页面:从相关的正文、相关推荐、专题页里补上链接,让蜘蛛有路径可以走到。
- 内容单薄但主题相近的页面:合并成一个页面,把零散内容整理到一处,而不是勉强给每个都补链接。
- 已经下架、没有用户价值的地址:直接返回 404 或 410,比留在那儿当孤儿更清楚。
- 确实无法放进导航的页面:至少写进 sitemap,并接受它的抓取和回访节奏会比内链页面慢。
内链是蜘蛛日常巡站的路线图,sitemap 更像一份提交清单。清单可以提交,路线才决定它多久来一次。
补内链时的几个细节
补链接不是随便堆几个地址就完事,下面几点更容易见效:
- 锚文本:用能概括页面主题的词,而不是“点击这里”“更多”。
- 链接位置:正文中的链接通常比页脚、侧栏的批量链接更被看重。
- 来源相关性:从同主题页面链过去,比从首页导航随便挂一个更有意义。
- 数量控制:一个页面被几个真正相关的页面链接,通常比被几十个无关页面挂上更合理。
- 层级:尽量让重要内容从首页出发三到四次点击就能到达,离入口太远的页面回访间隔会明显拉长。
孤儿页面不是必须消灭,但要知道哪些是主动保留、哪些是被遗忘的。定期做一次入口梳理,比事后反复提交地址更省事。