页面能不能被收录,起点往往不是提交,而是被发现。爬虫不会凭空知道一个 URL 存在,它需要从某个已经抓过的页面,顺着链接走过去。提交入口能起到提醒作用,但真正稳定、可控的发现渠道,还是站内链接结构。
爬虫发现新 URL 的几条路
归纳起来大致有这么几类:
- 外部链接:别的站点链到你的页面,爬虫顺着过来。可控性最低。
- 站内链接:导航、列表、正文内链,全在自己手里,是主要入口。
- XML 站点地图:集中列出 URL,适合补充和批量声明。
- 提交工具与抓取历史:能加速,但不是每次都会立刻触发。
其中只有站内链接是自己随时能改、改完很快生效的。把这一块理顺,通常比反复点提交更有意义。
站内入口的类型与作用差异
同样是一条链接,出现在不同位置,被对待的方式并不一样。
- 全局导航:几乎每个页面都有,指向稳定,一般会被优先抓取。
- 栏目列表页:一批同级页面的集中入口,适合中层页面。
- 面包屑:帮助爬虫理解层级,也提供向上回溯的路径。
- 正文内链:指向具体、内容相关的页面,适合长尾和较深的页面。
- 页脚全站链接:数量大、重复度高,实际作用常被高估。
判断标准不是链接数量,而是这条链接是否出现在内容语境里、是否有明确的指向理由。随手贴上去的链接,和正文里为了补充说明而加的链接,被理解的方式并不相同。
按页面重要程度分配入口
比较省事的做法,是先给页面分层,再决定入口放在哪。
- 核心页面:放进全局导航或首页直链,保证每次抓取都能路过。
- 中间层页面:由对应的栏目列表页覆盖,一层层往下递。
- 长尾页面:靠正文内链和站点地图,不必强求人人可见。
层级分清楚之后,入口的安排就有了依据,而不是所有新页面一起往首页塞。
入口安排上常见的三个问题
- 孤岛页面:只存在于站点地图里,站内没有任何链接指向它。被抓到的概率明显偏低,也难以判断它的重要度。
- 把新页面全部堆在首页:短期内首页链接数量暴涨,每个链接能分到的关注被稀释,首页本身的内容结构也容易被打乱。
- 依赖页脚堆砌:几百条链接铺满页脚,重复出现在全站每一页,既影响阅读,实际传递效果也未必好。
站点地图是补充,不是替代
XML 站点地图的价值在于把 URL 一次性交代清楚,适合新站上线、批量改版、深层页面较多的场景。但它替代不了内链:一个页面在站内没有任何链接指向,即便出现在站点地图里,对它重要程度的判断也缺少依据。更稳妥的做法是让两者互相印证——站点地图里列出的重要 URL,站内也应当有对应入口。
一份可执行的检查顺序
- 从这个页面出发,看它是否至少有一条来自内容区的链接指向它。
- 确认链接是可抓取的普通 a 标签,而不是依赖脚本执行后才出现。
- 检查该页面对应的层级列表页是否存在,并且能正常访问。
- 对照站点地图,确认重要 URL 没有漏掉。
- 最后再去看页面本身的内容质量,判断它是否值得进索引。
这个顺序的逻辑是:先解决“能不能被找到”,再解决“找到之后值不值得留”。不少收录问题,卡在第一步就已经结束了。
提交和站点地图解决的是“告诉”,内链解决的是“走到”。爬虫最终走的是后一条路。