一个页面能不能被收录,第一步往往不是内容好不好,而是它有没有被蜘蛛发现。发现、抓取、收录是三件事:地址没进入已知列表,后面两步都无从谈起。很多站点的收录问题追到源头,其实是 URL 发现这条路径断了。
蜘蛛发现 URL 的几条路径
搜索引擎长期维护着一张已知 URL 的图,新地址进入这张图主要靠几个入口:
- 已抓取页面里的链接:最主要的来源。蜘蛛抓完一页,会顺着源码里的 a 标签继续走。
- sitemap:适合补充内链覆盖不到的地址,但它更像一份清单,不保证按清单逐条抓取。
- 外部链接:其他站点链过来,同样会把地址带进索引体系。
- 站内其他信号:重定向、canonical、hreflang 指向的新地址,也可能被顺带发现。
其中内链是唯一由你完全掌控、又能持续发挥作用的入口。sitemap 提交之后长时间没动静,原因多半就在这里:入口是有了,优先级和上下文却不够。
哪些页面容易变成孤岛
孤岛页指站内没有任何或只有极少数链接指向它的页面。常见成因包括:
- 导航和列表由 JS 动态渲染,源码里没有可点的 a 标签。
- 文章页只从最新发布或时间归档里出现,过一段时间就被挤出列表。
- 详情页藏在搜索结果页、筛选结果页或表单提交后的页面里。
- 栏目分页被设成 noindex 或不输出链接,深层页面失去通道。
- 链接指向的是重定向链的起点,绕过几跳之后蜘蛛放弃继续跟。
- 内链带了 nofollow,或者写在按钮和 div 的点击事件上。
这类页面在后台看是正常发布,在索引侧看却像从未出现过。收录自查时如果发现整批页面都停在已发现、尚未抓取,可以优先怀疑入口太弱,而不是先怀疑服务器。
怎么确认一个 URL 有没有被抓取入口
- 在站内搜该地址的特征关键词,看是否只有 sitemap 提到它,没有任何页面链它。
- 查日志或抓取记录,确认蜘蛛对该地址是否有过访问请求。
- 检查页面源码而不是渲染后的 DOM,看是否存在指向它的 a href。
- 顺一遍从首页到该页的点击路径,看几跳能到。
如果一条路径都走不通,它基本就是孤岛。这时再优化页面内部结构,也很难被走到。
补入口的几种做法
- 加上下文内链:从主题相关的栏目页或文章正文里,用一两句话自然指向它,比在页脚堆一堆链接更有效。
- 打通聚合页:为同类页面建一个可被链接的分类页或专题页,让一批页面共享同一个入口。
- 补面包屑和相关推荐:位置固定、输出稳定,适合长期托底。
- 同步更新 sitemap:作为补充清单,与内链一起提交,不要只依赖它。
- 控制层级深度:重要页面尽量在三到四次点击内可达,层级越深,被走到的概率越低。
别把补链接做成链接农场
大量无差别、全站铺开的互链容易被判定为操纵行为,对收录没有正向作用。有效的补链是少量、相关、有上下文:链接文字和落点内容对得上,用户点过去也愿意看。另一个常见误区是把链接都塞进页脚或侧边栏,这些区域重复度高,能传递的信号有限。
URL 发现是收录链路的第一环。与其反复提交、反复催收录,不如先确认目标页面在站内至少有一条来自正文的自然链接,并且这条链接在页面源码里真的存在。