网站收录

内容少的页面要不要收录:先把它们分成功能页、过渡页和占位页

站内总有一批字数很少的页面,联系方式、空栏目、筛选页混在一起,该不该进索引不能一刀切。本文按功能页、过渡页、占位页三类拆开,给出可执行的判断顺序,并说明 noindex 与 robots 的常见误区。

网站收录

内容少的页面要不要收录:先把它们分成功能页、过渡页和占位页

站点做久之后,收录这件事常常不是「能不能被收录」,而是「该不该被收录」。很多站点的索引里混着一批字数很少的页面:联系方式、退换货说明、空栏目、标签聚合、站内搜索结果页。它们有的其实是用户真正需要的落地页,有的只是流程里的中转,还有的纯粹是模板生成出来的占位。把这三类混在一起处理,往往要么把有用的页面挡在索引外,要么把噪音留在索引里。

先分清三类,比一刀切更省事

判断一个内容少的页面要不要进索引,可以先问三个问题:用户会不会专门搜它?它有没有稳定的、自己的内容?它是不是被别的页面完整替代了?按这三个问题的答案,大致能分成三类。

功能性页面:通常值得进索引

关于我们、联系方式、配送与退换货政策、隐私政策、保修说明、门店地址,这类页面字数不多,但它们承担的往往是独立的需求。用户搜「某品牌 退换货」或者「某门店 电话」,落地页就是它们。这类页面就算只有几百字,也通常应该允许被抓取、被收录,并且要在页脚、主导航里给出稳定的内链入口。它们的问题是内容少,解决办法是补上真实信息——营业时间、适用条件、联系方式、常见问题,而不是直接 noindex。

过渡性页面:看它有没有稳定的独立内容

分类页、标签页、专题聚合页、分页,属于这一类。它们存在的意义是组织和分发,本身未必有原创文字。判断标准是:这个页面的列表内容是否会长期稳定,并且能覆盖一个独立的搜索需求。如果某个分类下常年有三五十条内容,主题清楚,那它值得进索引;如果只是站内任意组合筛选出来的结果,比如「颜色=红、尺码=M、价格=100-200」,这种页面数量可能是正文页的几十倍,内容还随库存变化,通常更适合收口。

占位页:先补内容,再谈收录

空栏目、没有任何内容的标签、尚未上线的专题、测试页面、模板残留页面,是收录里最不该出现的一类。它们没有用户价值,被抓取和索引只会消耗抓取预算,也会让索引质量变差。处理顺序建议是先看有没有补充内容的可能:如果这个栏目本来规划了内容,就把内容补齐;如果确定不会再做,就合并到上级页面或者下线,而不是一直挂在那里。

一个可执行的判断顺序

  1. 先确认页面有没有独立搜索需求。没有的话,继续往下看。
  2. 看它是不是被另一个页面完整覆盖。是的话,优先合并,而不是两个页面各留一份。
  3. 看内容是否会长期稳定。会变化、会随用户操作变化的页面,倾向于不进索引。
  4. 看数量规模。如果同类页面数量远超正文页,先抽查几十个,确认它们是否真能被搜到,再决定整体收口。
  5. 最后才考虑用 noindex 这类手段,并且只对确定不需要出现在搜索结果里的页面使用。

几个容易踩的坑

用 robots.txt 阻止抓取,不等于不进索引。被 robots 屏蔽的 URL,如果别处有链接指向它,搜索引擎仍可能把地址记进索引,只是拿不到内容。真正要让页面不进索引,一般用 noindex,而且这个标签要能被抓到才生效。

薄页面不等于低质量页面。联系方式页字数很少,但它解决了明确问题;一个堆了两千字废话的页面,价值也未必更高。判断依据是是否满足需求,不是字数。

收录数量上升不一定是好事。索引里多了一批筛选页和空标签,抓取预算被摊薄,真正重要的页面反而可能更新得更慢。定期抽样看索引里到底有什么,比盯总数更有意义。

如果一个页面的存在理由说不清楚——既不是给用户看的落地页,也不是给爬虫看的路由页——那它大概率不该出现在索引里。

定期复核比一次决定更重要

页面的性质会变。曾经的空栏目后来填满了内容,曾经的聚合页慢慢失去维护,都会改变它该不该被收录。可以按季度抽一次样本:从索引里随机取几十个 URL,看看它们是否还有独立价值、是否和别的页面重复、是否有明确的入口。发现已经不该保留的,就合并或收口;发现本该收录却被挡住的,就检查是不是标签用错或者内链断了。这样处理下来,索引会慢慢变得干净,收录这件事本身也会更可控。