网站收录

页面多了之后,收录要分层:哪些 URL 该推,哪些该收口

站点规模变大后,收录问题往往不再是单个页面的事。给站内 URL 分层——核心内容页、聚合长尾页、功能参数页、历史页,分别定目标:核心页推进抓取与收录,长尾页先判断独立价值,功能页从生成入口收口。定期复盘索引构成,比只盯总量更能看出问题。

网站收录

页面多了之后,收录要分层:哪些 URL 该推,哪些该收口

站点小的时候,收录问题通常是一个个页面的事:某个页面没收,就去查内链、查 noindex、查内容写得够不够。站点变大之后,问题会变成另一种形态——该收的迟迟不进索引,不该收的却源源不断,索引总量看着在涨,能带来搜索流量的页面却没几个。这时候更有效的做法不是逐个 URL 排查,而是先给站内 URL 分层,再按层的目标去定策略。

先给站内 URL 分个类

分类的标准不是页面做得好不好看,而是它承担什么角色,以及我们希望它出现在搜索结果里起什么作用。

  • 核心内容页:文章、产品详情、主要的栏目入口。这类页面是流量主力,目标是稳定被抓取、被收录。
  • 聚合与长尾页:标签页、分类翻页、多条件筛选、按地区或时间维度生成的聚合。价值参差不齐,需要逐个判断。
  • 功能页:站内搜索结果页、排序参数、登录、购物车、打印页、分享页。多数情况下不需要进索引。
  • 历史页:已结束的活动、下架的商品、被替换的旧版本。要么合并,要么明确退出索引。

分类做完,很多纠结会自然消失:一个站内搜索结果页该不该收录,取决于它属于哪一层,而不是取决于它页面上有没有写内容。

核心页:内链、站点地图和更新信号一起给

核心页的问题通常不是蜘蛛找不到,而是找到了但优先级不够。可以按这个顺序检查:

  1. 从首页出发,点多少次能到达这个页面。层级越浅,越容易被分配到抓取。
  2. 站点地图里是否只放了希望被收录的地址。把所有 URL 一股脑塞进去,等于把重要页面的信号稀释掉。
  3. 页面内容更新后,是否有指向它的内链同步更新,或者有新的入口把它重新推到抓取路径上。
  4. 规范链接是否指向自己,站内有没有另一个地址在讲同一件事。

这几条不需要一次做完,但每次上新内容时顺手带上,长期下来比事后补救要省力得多。

聚合与长尾页:先判断有没有独立价值

聚合页最容易出现两种极端:一种是确实能把相关内容组织起来,用户搜到这个页面也能得到答案;另一种只是把别处的标题抄了一遍,点进去还得再跳一次。判断标准可以简单一点:如果把这个页面单独拿给一个陌生用户看,他能不能在这里得到答案?能,就按核心页对待;不能,就有两种处理方式——补充它独有的内容,或者让它退出索引。

需要注意的是,聚合页数量往往很大,一旦处理方式不统一,索引里就会混进大量相似页面。处理时最好按类型批量决策,而不是今天改一个、明天改一个。

功能页和参数页:优先从生成入口收口

站内搜索结果页、排序参数、会话参数、跟踪参数,这类 URL 的共性问题是可以被无限生成。对它们,屏蔽抓取和禁止索引是两件事:

  • 用 robots 屏蔽抓取,可以减少被抓取的数量,但如果页面被外链指向,仍可能以无摘要的形式出现在结果里。
  • 用 noindex 需要页面能被抓取到才能生效,若同时屏蔽了抓取,这个指令往往读不到。

更根本的做法是控制生成入口:不让筛选组合出现在站内可点击链接里,不让跟踪参数写进内链,减少蜘蛛沿着参数一路往下爬的可能。

定期复盘索引的构成,而不只是看总量

索引总量只是一个数字,更值得看的是它由哪些页面组成。每隔一段时间,按上面几层分别统计被收录的页面比例,大致能看出问题方向:核心页收录率低,多半是结构和抓取的问题;功能页、参数页占比过高,多半是入口没有收口。

调整之后不要立刻下结论。抓取和索引都有延迟,给一两轮抓取周期再观察,比当天改完当天判断要可靠。

分层的意义不是把页面分成三六九等,而是让不同角色的 URL 走不同的路径:该被推荐的持续推,该被忽略的尽早收口。