页面进不了索引,很多人第一反应是蜘蛛没来。但蜘蛛得先知道这个 URL 存在,还得有一条路能走到它。如果站内没有任何链接指向某个页面,它就只能靠外部链接或站点地图被偶然发现,收录时间往往被拉得很长。
蜘蛛发现 URL 的几条常见路径
首页通常是抓取的起点,之后沿着导航、栏目页、列表页、正文里的内链一层层展开。除此之外,外部链接、站点地图,以及别人的转载引用,也会带来新的 URL。这几条路里,站内链接是唯一你完全可控、而且能持续生效的一条。
孤立页面通常长什么样
所谓孤立页面,指的是站内没有可点击链接指向它的页面。常见的情况包括:
- 页面只存在于后台或草稿状态,前端没有入口
- 只提交进了 XML 站点地图,站内没有任何链接
- 链接由 JS 动态渲染,但渲染失败或需要交互才出现
- 页面只出现在站内搜索结果里,不搜索就找不到
- 活动页、专题页下线后没做跳转,旧链接全部断掉
站点地图不能替代内链
站点地图的作用是告诉搜索引擎这些 URL 存在,但它不传递站内权重,也说明不了页面的重要程度。只靠站点地图被发现的页面,抓取优先级通常排在有内链的页面之后。
深层路径:点几下能到
除了有没有链接,还要看路径有多深。如果一条 URL 从首页出发需要点击五次以上才能到达,它被反复抓取的机会明显更少。常见的深层页面包括:多级筛选后的列表页、逐级展开的分类页,以及只在某个角落出现一次的详情页。
一次可以落地的自查
- 挑出最近没被收录的十个页面,逐个检查站内有多少条链接指向它。
- 看这些链接所在的页面本身是否被收录、是否被抓取。
- 用抓取工具或日志确认,蜘蛛在最近一次访问中是否走到了这些链接。
- 检查从首页到该页面的点击距离,超过四次的先想办法缩短。
- 确认关键内链是标准的 a 标签,而不是依赖 JS 或点击事件。
内链解决的是能不能被找到,不负责会不会被收录。页面质量、重复程度、规范 URL 上的问题,链接补得再多也绕不过去。
内链该怎么补
- 在相关文章、上下篇、同分类推荐里给出真实入口
- 用面包屑把详情页和栏目页连起来
- 为聚合页、标签页设置合理入口,但别让它们抢走详情页的权重
- 锚文本用与页面主题相关的词,不要全站统一写“点击这里”
- 避免在页脚堆大量无关链接,这类链接权重低且容易被忽略
什么时候该往内链方向排查
如果一批页面长时间停在“已发现,尚未抓取”,或者新上线的详情页始终不收录、而首页栏目页正常,可以先查内链和路径深度。反过来,如果页面已经被抓取多次却依然不进索引,重点就不在链接,而在内容与规范设置上。