網站收錄

按頁面類型定收錄策略:不是每個 URL 都值得進索引

收錄問题往往在頁面设計阶段就已埋下。與其等索引膨胀後再收拾,不如按模板给每類頁面定好收錄档位:哪些必须進索引,哪些可收可不收,哪些應当排除。本文给出判断頁面的四個問题、常见頁面類型的归属,以及内鏈、sitemap、canonical 與 robots meta 该如何保持一致。

網站收錄

按頁面類型定收錄策略:不是每個 URL 都值得進索引

很多站点的收錄問题並不是從被抓取那一刻才開始的,而是在頁面设計阶段就已经埋下。同一個站点里,有的頁面天生该進索引,有的頁面進去只是占位置。與其等到索引膨胀了再回头收拾,不如在上线前就按頁面類型定好收錄策略。

先分清三種收錄档位

把站内每一類頁面往三個档位里放,判断會清晰很多。

  • 必须被收錄:有獨立搜尋需求、内容自成一体、用戶會直接搜到它的頁面。
  • 可收可不收:有一定聚合價值,但和別的頁面高度相似,收不收取决于站内是否缺這一類入口。
  • 不该進索引:只服務于站内流程、内容重复,或者由參數组合爆炸产生的頁面。

關键在于:這個判断要按模板来做,而不是按單條 URL。模板决定了成百上千個頁面的命运。

常见頁面類型的归属

内容頁

文章、商品、問答這類主体内容頁,通常属于必须收錄的一档。前提是内容确實獨立——同一篇内容出現在多個 URL 上时,要先收敛再谈收錄。

栏目頁與分類頁

處在可收可不收與必须收錄之間。如果分類頁只有一列标题,價值接近導航;如果它带有篩選後的獨立信息,比如價格区間、地区、規格,則值得收錄。判断标准是:用戶會不會為了這一類内容专门去搜。

标簽頁與作者頁

标簽數量少、每個标簽下有足够内容时,可以留少量進索引;一旦标簽由系統自動生成、動辄上千個且每個只挂着两三篇,通常更接近不该進索引那一档。

篩選、排序與追踪參數

這些 URL 本身不承载新内容,只是同一批内容的排列组合。預設不進索引,靠 canonical 标簽或 robots meta 表達。

站内搜尋结果頁

属于典型的不该收錄。它随查询词無限生成内容,既不稳定也没有獨立價值。

附件與打印頁

PDF、图片、打印版本本身不是問题,問题是有没有一個 HTML 頁面承担了同样的信息。如果已经有,附件通常不需要單獨去争索引位置。

判断一個頁面该不该收,先問四個問题

  1. 有没有人會把它当作搜尋的终点?
  2. 它有没有本站其他頁面無法替代的内容?
  3. 它會不會長期稳定存在,還是随參數、库存、會话變化?
  4. 如果把它從索引里拿掉,用戶的搜尋结果會不會變差?

前两個問题答否,基本就可以放進不收錄那一档。

决定之後,要在几個地方同时表達

收錄策略不是寫在文档里就算數的,它需要在多個信号上保持一致:

  • 内鏈:不该被收錄的頁面,不必從導航和正文里反复给出入口。
  • sitemap:只提交你希望進索引的地址,不要把站内所有 URL 一股脑塞進去。
  • 頁面标记:用 canonical 标明首選版本,用 robots meta 的 noindex 明确排除。
  • robots.txt:它管的是抓取,不是收錄,不要拿它当排索引的工具。
一個常见誤区是:既寫了 noindex,又在 sitemap 里提交同一個地址,還在内鏈里大量指向它。信号互相打架,最终只能靠搜尋引擎自己猜。

上线之後怎么回头看

策略定完不代表一劳永逸。上线一段時間後,可以按模板抽查:被索引的 URL 數量是否和预期量級接近;有没有本该 noindex 的頁面出現在索引里;反過来,该收錄的頁面是否長期停在已發現、未编入索引的狀態。發現問题先检查信号是否一致,再考虑内容本身。

需要說明的是,這些動作的作用是让希望被收錄的頁面更清楚地表達自己,减少無谓消耗,並不等于提交了就一定被收錄。索引的最终取舍權在搜尋引擎手里,我們能做的只是把判断依據给足。