一个页面能不能被收录,第一步不是内容质量,而是蜘蛛有没有走到它。除了 sitemap 和手动提交,日常最稳定、也最容易被忽略的发现路径是站内链接。链接怎么铺、页面离首页有多远,会直接影响蜘蛛撞见它的概率和频率。
蜘蛛是怎么走到新页面的
搜索引擎通常从一批已抓取的页面出发,顺着页面上的 a 标签继续爬。sitemap 更像是线索清单,帮助发现 URL,但不等于会被抓取,更不等于会被收录。真正的爬行路径,多数时候还是站内链接。
- 首页、栏目页、列表页、详情页之间的常规跳转;
- 相关推荐、上一篇/下一篇、标签聚合;
- 面包屑、HTML 版站点地图页、全站导航;
- sitemap、外链、提交接口等辅助入口。
链接深度:粗略但好用的一把尺
链接深度一般指从首页出发,最少点几次链接能到达目标页。它不是硬指标,但能反映可达性的好坏。
- 1–2 层:通常是导航、栏目、重点聚合页,被抓取相对稳定;
- 3–4 层:多数详情页的正常区间,依赖列表页和内链支撑;
- 5 层以上:往往要翻很多次分页或多级聚合才能到达,抓取频次容易偏低;
- 只能通过 sitemap 找到、站内没有入口的页面:属于孤儿页面,抓取和更新都比较被动。
深度只是影响因素之一。同样深的页面,如果外部链接多、更新频繁、被其他页面引用得多,抓取表现也可能明显更好。
让重要页面离首页更近的做法
导航与栏目结构
把需要被收录的页面类型放进主导航、栏目页或聚合页,让它们至少有一个人人可见的入口。层级不宜过深,但也不必为了压平把全站链接塞进首页。
列表页与推荐位
- 列表页保持稳定的翻页逻辑,让翻页链接可被正常抓取;
- 详情页底部放相关推荐、同栏目最新几条,形成横向链接;
- 新增内容在栏目页、首页或专题页露一次面,通常比干等 sitemap 更有用。
面包屑与站点地图页
面包屑提供了回到上一层的路径,也让蜘蛛更容易理解层级关系。一个 HTML 版的站点地图页(不是 XML sitemap)可以作为兜底入口,集中列出主要栏目和重要页面。
孤儿页面和只靠 sitemap 的页面
这类页面在站内没有任何链接指向,蜘蛛只能通过 sitemap 或外链知道它的存在。它们不一定收录不了,但抓取往往更慢、更不稳定,更新后重新被抓取的间隔也更长。如果页面本身有收录价值,建议至少给它一个站内入口。
自查的顺序
- 挑几个希望被收录的页面,手动从首页数一数要点几次才能到达;
- 确认这些页面是否真有站内链接指向,可用抓取工具或站内搜索核对;
- 看服务器日志中这些 URL 的抓取记录,判断是否长期没有蜘蛛访问;
- 检查链接是否被 nofollow、是否依赖 JS 渲染后才出现、是否被 robots.txt 挡住;
- 确认页面自身没有 noindex,返回状态码正常。
几个常见误区
- 越扁平越好:把几十上百个链接堆到首页,既稀释权重,也不利于用户查找;
- 链接多就等于收录快:无意义的互链、页脚堆链接,实际作用有限,还可能被判为过度优化;
- 提交了 sitemap 就等收录:sitemap 解决的是发现,抓取和收录还取决于页面质量与站点整体表现。
内链深度不是唯一变量,但它是一个自己就能控制、改完较快能看到变化的因素。先把重要页面的入口理顺,再去看内容质量和重复内容问题,排查顺序会清楚很多。