蜘蛛进站之后,手里没有你画的路线图,它能依靠的只有链接。站点地图可以告诉它站点里有哪些 URL,但真正决定它先看什么、走到多深的,是页面上那些可点击的链接。链接摆在哪儿,蜘蛛的路就铺到哪儿。
链接的位置比数量更重要
同一批链接,放在导航里和放在页脚,蜘蛛给出的待遇并不一样。位置越靠近页面主体、越稳定、数量越克制,越容易被反复走到。
主导航
主导航是全站最容易被抓取的链接块,几乎每个页面都有,蜘蛛从任何一个入口进来都能顺着它走一遍。所以它适合放栏目的核心页,不适合塞进几十个二级、三级入口。导航一旦膨胀,每个链接分到的关注就被摊薄。
面包屑
面包屑的作用是把层级关系说清楚:首页 → 分类 → 子类 → 详情。蜘蛛顺着它能确认自己处在站点的哪一层,也能从详情页快速退回分类页,减少爬到一半就停住的情况。面包屑里的链接建议用正常的 a 标签,不要做成纯样式文字。
正文内链
正文里自然出现的链接,往往是权重传递最有效的一类。它带着上下文,指向的页面和当前内容相关。比起在文章末尾堆一长串“相关阅读”,正文里三五个真正相关的链接,对 URL 发现的帮助通常更实在。
页脚和侧栏
页脚适合放少量全站通用的页面,比如关于我们、联系方式、站点地图。它的风险是容易变成链接仓库:几十上百条链接铺满整块,蜘蛛每次来都要重新走一遍,真正需要被发现的新页面反而排在后面。
几个常见的内链坑
- 导航用 JavaScript 生成。如果导航是渲染后才出现的,蜘蛛在某些情况下可能拿不到这些链接,站内路径就等于断了一截。
- 重要页面只从一个入口进入。只挂在某篇旧文章里的新页面,发现速度完全取决于那篇文章被抓取的频率。
- 链接文字全是“点击这里”。蜘蛛并不直接靠锚文本排名,但清楚的锚文本能帮你判断自己铺的路是否符合预期,也是自查内链的好线索。
- 分页、筛选、排序链接混进导航。这类 URL 会快速膨胀,把可抓取的链接位挤占掉。
自查时可以这样做
- 随手打开一个中间层页面,看首页到它之间有没有一条三步以内的链接路径。
- 关掉 JavaScript 再打开页面,检查导航和面包屑里的链接还在不在。
- 数一数页脚和侧栏的链接总数,把不承担 URL 发现任务的链接清掉。
- 看日志里被抓取最多的页面清单,确认这些页面是不是你真正希望蜘蛛花时间的地方。
内链的目标不是让蜘蛛看到所有页面,而是让重要的页面有一条稳定、少绕路、能被反复走到的路径。
把链接位置理清楚之后,再去看站点地图、抓取预算这些话题会轻松很多:地图负责说明有哪些 URL,内链负责让蜘蛛愿意并且能够走过去,两者配合,URL 发现才有稳定的节奏。