先按頁型拆分,再看收錄資料
站点收錄量出現波動时,很多人的第一反應是去查某一批 URL 或者某個模板改坏了。更省事的做法是先把站内頁面按頁型分一分:列表頁、詳情頁、专题聚合頁、标簽頁、分頁頁。它們被蜘蛛抓取的频率、被索引的理由、内容更新的节奏都不太一样,混在一起看平均收錄率,往往看不出問题出在哪一层。
搜尋蜘蛛對不同頁型的预期本来就不同。列表頁會随新内容上线持續變化,蜘蛛来的次數通常更多;詳情頁一旦定稿,改動有限,抓取频率自然低。抓得勤不等于容易被收錄,抓得少也不代表被放弃,這两個指标要拆開看。
列表頁:抓得多,但要给出收錄理由
列表頁最常见的問题是“只有标题和連結”。這種頁面在蜘蛛看来缺少獨立内容,即使被频繁抓取,也可能長期停留在“已抓取但未编入索引”的狀態。
- 给栏目补上简短的編輯說明或分類描述,让頁面本身有可讀文本;
- 空栏目、只有一两條内容的列表頁,先別急着让它進索引;
- 分頁連結用規范的 URL 形式,避免參數拼接出大量近似頁面;
- 翻頁頁面的索引策略保持一致,別让第二頁、第三頁各自為政。
如果日誌里列表頁的抓取很频繁、收錄比例却一直不高,通常不是抓取出現問题,而是頁面本身缺少能被判断為“有獨立價值”的依據。
詳情頁:内容主体能不能提取,决定结果
詳情頁的核心矛盾在内容侧。蜘蛛能不能顺利拿到正文,直接影响它對頁面的判断。
- 正文是否被模板、推荐位、评论、广告稀释,主体部分要足够集中;
- 内容靠前端渲染时,先確認蜘蛛拿到的是完整 HTML 還是空壳;
- 同一商品或同一主题下參數只差一点点的頁面,容易互相稀释;
- 正文過短、结构高度雷同的頁面,收錄後也容易被判定為低價值。
這一類頁面的典型信号是:抓取次數正常,收錄率却明顯低于同類頁面。此时調整模板结构、补充正文,通常比反复提交 URL 更有用。
专题頁與标簽頁:聚合要有邊界
聚合頁的價值在于把零散内容组织成新的入口,但标簽最容易失控——每加一個關鍵詞就多一個頁面,几十個标簽頁里可能只有几個有稳定需求。
比較稳妥的做法是给聚合頁设一條门槛:内容量達到一定規模、有明确的组织逻辑,再让它進索引;長期只有一两條内容的标簽頁可以先用 noindex 處理。這里要注意它和 robots.txt 的区別——noindex 是阻止收錄,robots.txt 是阻止抓取,用反了會挡住蜘蛛讀取 noindex 标簽。
按頁型排查的四個步骤
- 把蜘蛛日誌按 URL 目錄或模式分组,算出各頁型每天的抓取频次;
- 抽样检查各頁型的索引狀態,估算大致收錄比例;
- 對比各頁型的入口數量、内容量和更新频率,找出明顯掉队的那一類;
- 只针對這一類做調整,观察两到四周,而不是同时改所有頁型。
两個容易混淆的判断
一是把抓取频次当成收錄指标。蜘蛛频繁来訪只說明 URL 被發現得勤,和是否進索引是两件事。二是把單頁波動当成整体趋势——某几個 URL 掉出索引很常见,只有当同一頁型的收錄率一起往下走,才值得系統排查。
按頁型拆分資料,比盯着全站平均收錄率更容易找到真正的原因。
收錄本身没有统一的通關标准,不同頁型承担的角色不同,判断标准也應该不同。先把頁型分清楚,再回头去看抓取、内容质量和 URL 規范,排查方向會清晰很多。