不少站点把收录慢归结为提交不够、蜘蛛不来,但在访问日志里往往能看到更朴素的原因:目标页面没有一条稳定、可见的站内入口链接。抓取是沿着链接走的,链接出现在哪里、出现几次、是否在渲染前就存在,直接决定了 URL 被发现的顺序和频率。
蜘蛛先看到链接,再看到页面
大致流程是:爬虫从已知地址出发,解析页面里的链接,把新 URL 放进待抓取队列,再按队列安排访问。也就是说,一个页面在被抓取之前,必须先有人给它指路,而这个指路动作通常就是链接。完全没有链接的页面,只能依赖站点地图、外部链接或历史抓取记录被发现,路径要脆弱得多。
不同位置的链接,作用不一样
- 主导航:全站可见,通常被优先抓取,适合承载频道页和核心栏目。
- 面包屑:体现层级关系,帮助爬虫理解页面在站点中的位置。
- 列表页与聚合页:新内容最常见的发现入口,列表更新频率往往决定新页面的发现速度。
- 正文内链:上下文相关,指向的多为同类内容,有助于主题聚类。
- 页脚:全站重复出现,价值有限,适合放政策与帮助类页面,不适合塞进大量文章链接。
- 站点地图:适合补充那些自然链接很少、但希望被抓取的 URL,但它不能替代内链。
哪些页面容易变成孤岛
- 只存在于站内搜索或筛选结果中的页面,入口藏在参数后面。
- 需要点击后才由脚本生成的链接,渲染前的 HTML 中并不存在可抓取的地址。
- 分页很深的商品页或文章页,要翻到很多页之后才有第一条入口。
- 活动专题下线后撤掉了导航入口,链接只剩在早期推送里。
- 新站一次性上线大量页面,除了站点地图,没有任何站内通路。
一份可执行的调整顺序
- 先确定真正希望被收录的 URL 清单,数量控制在能长期维护的范围内。
- 逐个检查这些 URL 是否至少有一条来自站内的稳定链接,并且不依赖脚本渲染才出现。
- 把核心页面放进主导航或一级列表页,长尾页面放进与主题相关的聚合页。
- 精简页脚和侧栏的全站重复链接,把有限的链接位置留给需要被发现的页面。
- 让关键列表页保持更新,新内容发布时就同步获得入口。
- 用站点地图覆盖确实没有自然入口的 URL,同时优先补齐内链缺失的问题。
怎么核对调整是否生效
改完之后不要只盯着收录数量,先看抓取日志:目标 URL 有没有被访问、来源页是哪一个、访问频率有没有变化。再对照索引状态,观察是否从“已发现,尚未编入索引”逐步转向被索引。这个过程通常以天到周计,不同站点差别很大,不宜按天催促。
内链只解决“能不能被发现”,并不保证被收录。页面质量、重复程度和站点整体情况,仍然决定索引最终是否采纳。
需要留意的边界
内链优化不是把链接堆满页面。一个页面上链接过多,会稀释每条链接被跟随的机会,也让页面结构变得杂乱。比起数量,更值得关注的是:重要页面是否拥有稳定、语义清晰的入口,并且这些入口在页面最初返回的 HTML 里就能被看到。