很多站点在做收錄检查时,习惯把所有URL放在一張表里,用同一個标准判断“该不该被索引”。结果往往是两種极端:一類頁面明明只是入口或過渡頁,却被要求必须收錄;另一類真正承载搜尋需求的内容頁,因為與其它頁面混在一起看,問题被平均掉了。收錄策略如果能先按頁面類型分组,判断會清楚很多。
统一标准為什么容易失效
不同類型頁面的存在目的本来就不同。詳情頁解决的是“用戶想了解具体事物”的需求,列表頁解决的是“浏览與篩選”的需求,而登入頁、购物车、结果頁、參數頁更多是功能路径上的一环,用戶從搜尋结果直接進入的意义並不大。
如果對這些頁面使用同一套“必须有内容、必须被收錄”的标准,要么會為了凑内容给功能頁硬加文字,要么會因為功能頁没收錄而誤判整站健康度。
先把站内URL分成三類
核心頁
通常是與主要搜尋需求直接對應的頁面,例如商品詳情、文章詳情、主要分類頁。它們的判断重点是内容是否完整、是否有獨立存在的必要、是否與其它頁面高度重复。
辅助頁
承担導航和分發作用,例如次級分類、标簽頁、系列頁。它們的價值取决于是否提供了獨特的浏览路径。如果只是堆积相似條目,與主分類高度重叠,被索引的意义就有限。
邊界頁
包括篩選结果、排序參數、站内搜尋结果、分頁、會话類URL等。這類頁面的數量往往最大,也最容易出問题:參數组合产生的重复版本,會把抓取预算和索引位占用掉。
分组之後,每類看什么指标
- 核心頁:看是否被索引、索引的版本是否為規范URL、内容是否與主体一致。
- 辅助頁:看是否有獨立入口、是否與上級頁面内容重叠、是否存在大量近似頁面互相稀释。
- 邊界頁:看參數是否可枚举、是否被robots或canonical约束、是否真的有必要让搜尋引擎抓取。
這里要区分抓取與收錄:被抓取不代表會被索引,邊界頁被抓取是正常的,關键是不让它生成大量無意义的索引版本。
落地步骤
- 從站点地图、日誌和站内連結中導出一份URL清單,尽量覆盖真實存在的地址。
- 给每條URL打上類型标簽,先粗分三類即可,不必追求绝對准确。
- 為每一類寫下索引预期:希望被索引、可有可無、明确不希望被索引。
- 按预期检查現状,把差异归類:是没被發現、被發現但没索引,還是索引了错誤的版本。
- 定期复核,尤其是站点改版、增加新模块之後,頁面類型可能會發生變化。
几個容易忽略的点
邊界頁不是洪水猛兽。有些篩選组合确實有搜尋需求,用一個可索引的固定URL承载它,比让它以無數组參數形式存在更清晰。關键是做選擇,而不是全部放開或全部屏蔽。
收錄不是越多越好,也不是越少越干净。真正需要回答的是:這個頁面在搜尋结果里出現时,是否比站内其它頁面更适合承接這個需求。
把頁面分组之後,你會更容易看出問题出在哪一层:是入口没铺好導致没被發現,是重复版本太多導致代表URL不明确,還是頁面本身内容不足。三種原因對應的處理方式完全不同,混在一起看,只會让收錄問题一直悬着。