网站收录

抓取配额应该先分给哪些 URL:按页面价值分级的排序思路

站点越大,蜘蛛的抓取次数越像一种有限资源。本文从日志入手,分清抓取与收录的区别,给出按页面价值给 URL 分级的思路,并通过内链、参数规范和分页策略,把抓取配额优先分给核心页面。

网站收录

抓取配额应该先分给哪些 URL:按页面价值分级的排序思路

站点做到几百上千个 URL 之后,很容易遇到一种情况:日志里蜘蛛来得很勤,但抓的多是筛选页、排序页、站内搜索结果页;真正想被发现的栏目页和详情页反而迟迟没人访问。这通常不是蜘蛛偷懒,而是站点的入口把抓取配额引到了低价值的地方。

先分清抓取和收录

被抓取,只说明蜘蛛把 URL 取回去看过一次;被收录,是搜索引擎判断这个页面值得放进索引。两者之间隔着内容质量、重复度、站内上下文好几道判断。所以抓取配额要解决的问题是:让蜘蛛把有限的访问次数花在值得被判断的页面上,而不是保证某个页面一定进索引。

先看清楚配额被谁消耗了

打开服务器日志,按目录或 URL 特征分组统计蜘蛛的访问次数,通常能找出几个吃配额大户:

  • 带参数的筛选、排序、价格区间链接,组合起来数量可以无限膨胀;
  • 站内搜索结果页,被蜘蛛顺着表单或链接抓到;
  • 翻页过深的列表页,第 30 页以后基本没有独立价值;
  • 同一内容的不同版本:打印页、分享页、移动参数版;
  • 批量生成的标签页、作者归档页,往往只有标题列表。

按页面价值给 URL 分级

分级不需要很复杂,按是否有独立内容、是否有人愿意点进来判断即可:

  1. 一级:栏目页、专题页、核心详情页,是抓取优先保障对象;
  2. 二级:有实际内容的文章、常见问题页、必要的分页;
  3. 三级:筛选、排序、标签、作者归档,允许被抓但不必主动推;
  4. 四级:站内搜索、空结果页、测试页、后台残留页面,尽量不让蜘蛛进入。

用内链把优先级传出去

蜘蛛主要靠链接找路,内链的位置和数量就是你给出的优先级信号。

  • 一级页面尽量从首页或栏目页用少量高相关文字链接直达,别埋在四五层之下;
  • 三级页面不要在每个页面底部铺全量链接,那会稀释一级页面的入口;
  • 分页保留可以点开的形式,慎用加载更多把所有结果塞进一个页面;
  • 四级页面优先用站内规则拦住,比如 robots 元标签或 robots.txt。
注意 noindex 和 robots.txt 的分工:被 robots.txt 拦住的页面,蜘蛛读不到 noindex,所以两者混用常常出现明明设了 noindex、索引里却还在的情况。需要 noindex 生效,页面就得允许被抓取。

减少重复 URL 造成的浪费

同一份内容对应多个 URL,会让抓取配额白花好几份。可以按这个顺序处理:先统一协议、大小写、尾斜杠这类规范写法;再用 canonical 指定主版本;投放用的追踪参数只用于外部渠道,不进入站内链接。

调整之后怎么验证

改完不要立刻下结论,观察两到四周:目标目录的抓取次数占比是否上升、状态码里 200 的比例是否提高、被抓取较多的页面是否开始出现收录变化。一次改太多,反而分不清哪一步起了作用。

常见误区

  • 以为抓取次数越多收录就越快,其实方向错了再频繁也无效;
  • 一次性把成千上万个 URL 推给搜索引擎,注意力被摊薄;
  • 长期放任蜘蛛抓筛选页,核心页面迟迟得不到访问;
  • 只盯着提交动作,不看日志里蜘蛛实际去了哪里。

抓取配额的管理,本质是把站点的结构、内链和参数规则整理清楚,让蜘蛛少走弯路。它不承诺收录,但能让真正有价值的页面更早进入被判断的队列。