網站收錄

内容少的頁面要不要收錄:先把它們分成功能頁、過渡頁和占位頁

站内總有一批字數很少的頁面,联系方式、空栏目、篩選頁混在一起,该不该進索引不能一刀切。本文按功能頁、過渡頁、占位頁三類拆開,给出可执行的判断顺序,並說明 noindex 與 robots 的常见誤区。

網站收錄

内容少的頁面要不要收錄:先把它們分成功能頁、過渡頁和占位頁

站点做久之後,收錄這件事常常不是「能不能被收錄」,而是「该不该被收錄」。很多站点的索引里混着一批字數很少的頁面:联系方式、退換货說明、空栏目、标簽聚合、站内搜尋结果頁。它們有的其實是用戶真正需要的落地頁,有的只是流程里的中轉,還有的纯粹是模板生成出来的占位。把這三類混在一起處理,往往要么把有用的頁面挡在索引外,要么把噪音留在索引里。

先分清三類,比一刀切更省事

判断一個内容少的頁面要不要進索引,可以先問三個問题:用戶會不會专门搜它?它有没有稳定的、自己的内容?它是不是被別的頁面完整替代了?按這三個問题的答案,大致能分成三類。

功能性頁面:通常值得進索引

關于我們、联系方式、配送與退換货政策、隐私政策、保修說明、门店地址,這類頁面字數不多,但它們承担的往往是獨立的需求。用戶搜「某品牌 退換货」或者「某门店 电话」,落地頁就是它們。這類頁面就算只有几百字,也通常應该允许被抓取、被收錄,並且要在頁脚、主導航里给出稳定的内鏈入口。它們的問题是内容少,解决办法是补上真實信息——营业時間、适用條件、联系方式、常见問题,而不是直接 noindex。

過渡性頁面:看它有没有稳定的獨立内容

分類頁、标簽頁、专题聚合頁、分頁,属于這一類。它們存在的意义是组织和分發,本身未必有原创文字。判断标准是:這個頁面的列表内容是否會長期稳定,並且能覆盖一個獨立的搜尋需求。如果某個分類下常年有三五十條内容,主题清楚,那它值得進索引;如果只是站内任意组合篩選出来的结果,比如「颜色=红、尺碼=M、價格=100-200」,這種頁面數量可能是正文頁的几十倍,内容還随库存變化,通常更适合收口。

占位頁:先补内容,再谈收錄

空栏目、没有任何内容的标簽、尚未上线的专题、測試頁面、模板残留頁面,是收錄里最不该出現的一類。它們没有用戶價值,被抓取和索引只會消耗抓取预算,也會让索引质量變差。處理顺序建议是先看有没有补充内容的可能:如果這個栏目本来規划了内容,就把内容补齐;如果确定不會再做,就合並到上級頁面或者下线,而不是一直挂在那里。

一個可执行的判断顺序

  1. 先確認頁面有没有獨立搜尋需求。没有的话,繼續往下看。
  2. 看它是不是被另一個頁面完整覆盖。是的话,優先合並,而不是两個頁面各留一份。
  3. 看内容是否會長期稳定。會變化、會随用戶操作變化的頁面,倾向于不進索引。
  4. 看數量規模。如果同類頁面數量遠超正文頁,先抽查几十個,確認它們是否真能被搜到,再决定整体收口。
  5. 最後才考虑用 noindex 這類手段,並且只對确定不需要出現在搜尋结果里的頁面使用。

几個容易踩的坑

用 robots.txt 阻止抓取,不等于不進索引。被 robots 屏蔽的 URL,如果別處有連結指向它,搜尋引擎仍可能把地址记進索引,只是拿不到内容。真正要让頁面不進索引,一般用 noindex,而且這個标簽要能被抓到才生效。

薄頁面不等于低质量頁面。联系方式頁字數很少,但它解决了明确問题;一個堆了两千字废话的頁面,價值也未必更高。判断依據是是否满足需求,不是字數。

收錄數量上升不一定是好事。索引里多了一批篩選頁和空标簽,抓取预算被摊薄,真正重要的頁面反而可能更新得更慢。定期抽样看索引里到底有什么,比盯總數更有意义。

如果一個頁面的存在理由说不清楚——既不是给用戶看的落地頁,也不是给爬虫看的路由頁——那它大概率不该出現在索引里。

定期复核比一次决定更重要

頁面的性质會變。曾经的空栏目後来填满了内容,曾经的聚合頁慢慢失去维護,都會改變它该不该被收錄。可以按季度抽一次样本:從索引里随机取几十個 URL,看看它們是否還有獨立價值、是否和別的頁面重复、是否有明确的入口。發現已经不该保留的,就合並或收口;發現本该收錄却被挡住的,就检查是不是标簽用错或者内鏈断了。這样處理下来,索引會慢慢變得干净,收錄這件事本身也會更可控。