很多站点的问题不是页面写得不够好,而是蜘蛛根本走不到那个页面。站内 URL 的可达性,是发现和抓取的前置条件,而可达性主要由内链决定。站点地图和主动提交能帮上忙,但它们更像是补充通道,不是主路。
蜘蛛发现新 URL 的几条路径
从优先级上看,搜索引擎拿到一个新地址,通常依次来自这几个地方:
- 站内链接跳转:从已抓取页面顺着 a 标签 href 走出来,这是最主要、也最稳定的入口;
- 站点地图:作为补充,帮助确认站点结构,但不保证每条都被抓;
- 外部链接:其他站点指向你的链接,尤其是权重较高的来源;
- 手动提交:可以在一定程度上加快发现,但决定不了后续结果;
- 历史记录:之前被抓过的地址,会被重新排期。
可以看出,除了外链和提交,剩下的都依赖站内结构。如果内链本身断了,页面就只剩站点地图这一条细线。
什么是“孤儿页面”
孤儿页面指的是站内没有任何链接指向、或者指向路径藏得很深的 URL。常见表现有几种:
- 页面上只能通过搜索框输入关键词才能到达;
- 链接由 JavaScript 在交互后才生成,初始 HTML 里看不到;
- 只在 XML 站点地图里出现,正文中没有任何入口;
- 被放在需要连续点击五六层才能到达的位置;
- 由筛选参数、排序参数动态拼出来的地址。
这些页面不一定是低质量内容,但对蜘蛛来说,它们缺少“被引荐”的信号,自然容易排在队列后面。
内链影响的不只是发现
内链的作用通常被简化成“让蜘蛛爬过来”,其实还有两层:
- 上下文:链接周围的文字和锚文本,会影响搜索引擎对这个页面主题的理解;
- 重要程度:一个页面被多少入口指向、入口本身有多重要,会影响它的抓取频率和更新节奏。
所以内链调整不只是技术活,也涉及内容组织方式。
自查:把被埋住的页面找出来
- 用抓取工具跑一遍全站,导出一份内链图谱,标出没有入链的 URL;
- 把站点地图里的地址和内链集合做差集,差集里的通常就是孤儿页面;
- 翻服务器日志,看哪些页面长期没有蜘蛛访问记录;
- 检查导航、面包屑、分类页和相关推荐,确认关键栏目都有人口;
- 按目录分组统计,看看问题集中在哪一类页面上。
做完这几步,通常会发现问题集中在某个栏目或某种模板上,而不是全站均匀分布。
几个常见的判断误区
链接写在 JavaScript 里就一定生效
如果链接是点击后才由脚本插入的,或者只是给 div 绑定了点击事件而没有真正的 a 标签 href,那么渲染之前它并不算一条链接。尽量保证关键入口出现在初始 HTML 中。
只要放进站点地图就够了
站点地图能帮助确认地址存在,但它代替不了内链带来的上下文和重要度信号。两者是互补关系。
链接越多越好
在页脚堆几百个全站链接,或者在正文里塞入大量无关链接,反而会稀释每条链接传递的信号,也不利于用户阅读。
调整内链时的几个做法
- 从主题相关的正文里加自然链接,而不是只在导航里补一条;
- 给成系列的内容做一个聚合入口页,让深层文章有稳定的上游;
- 控制点击深度,重要内容尽量在三次点击内到达;
- 清理死链和指向已下架页面的链接,避免把蜘蛛引向空地址;
- 检查 nofollow 的使用,别把本该被发现的入口挡掉;
- 分批修改,改完观察一段时间日志,确认蜘蛛确实走到了新入口。
内链解决的是“能不能被发现”,收录与否还要看内容质量、页面状态和抓取排期,这两件事不要混为一谈。
把内链理顺,往往比反复提交 URL 更有效。它不需要额外申请什么,只需要在内容组织上多花一点心思,让每个值得被收录的页面,至少有一条清晰的入口。