收錄报表里的總數,掩盖了頁面類型的差別
後台的索引覆盖报告通常只给一個總數,或者简單分成“已编入索引 / 已排除”两類。但站点里的頁面並不是同一類東西:首頁、栏目頁、聚合頁、詳情頁、辅助頁,它們在内鏈结构里的位置、更新频率、被訪問的可能性都不同。把這几類混在一起看,很容易得出“收錄率很低”或“收錄没涨”的结论,而實际的問题可能只集中在某一個模板上。
頁面類型的角色分工
- 首頁與一級栏目頁:站点的结构枢纽,内鏈最集中,通常是蜘蛛訪問最频繁的一层。這類頁面如果長期不進索引,問题多半出在站点层,而不是單頁内容。
- 二三級栏目頁與聚合頁:數量中等,多由規則生成,容易被篩選參數、排序參數带出大量近似 URL。
- 詳情頁:數量最多、更新最勤,是收錄的主体。它們的收錄速度高度依赖上一級栏目的内鏈,以及列表分頁是否可抓取。
- 辅助頁:登入、註冊、购物车、站内搜尋、後台入口、部分标簽頁。這類頁面本来就不需要進索引,被排除是正常结果。
收錄预期本来就不一样
把“每個 URL 都要被收錄”当作目标,是常见的誤解。抓取配額和索引空間都是有限的,搜尋引擎會優先把资源给到结构上更容易到達、更新更稳定、内容更獨立的頁面。所以合理的预期應该是分层的:枢纽頁和主力詳情頁應当進索引;辅助頁可以主動排除;中間层的聚合頁要先判断有没有獨立價值,再决定放開還是收口。
按類型核對的顺序
- 先给 URL 分類:按目錄、URL 模板或頁面模板把站内 URL 归入几大類,不要逐個頁面去看。
- 再看抓取分布:從服務器日誌里統計各類頁面被訪問的次數與狀態碼。如果某一類几乎没被抓過,谈收錄還太早。
- 再看索引狀態:把每一類的“已编入索引”比例單獨算出来,而不是只看全站平均值。
- 再看入口與内鏈:检查這類頁面是否真的有可爬取的入口,列表分頁是否可点,面包屑和正文内鏈是否指向它們。
- 最後决定放開還是收口:低價值的重复版本用 canonical 或 noindex 處理;确有價值的頁面补入口、补内鏈,而不是急着反复提交。
几個常见的判断走偏
看到詳情頁收錄率低,就归因于“内容质量不够”,其實更常见的原因是入口太深、列表分頁不可抓,或者 canonical 指错了地方。
另一類走偏是反過来:把辅助頁被排除当成故障,反复修改指令,结果让搜尋引擎看到前後不一致的信号。索引狀態本身就是一種取舍结果,保持稳定通常比频繁調整更有利。
给站点运营的實际建议
- 為每一類頁面單獨建一個观察清單,分別记錄抓取频次與索引狀態,避免用全站平均掩盖問题。
- 列表頁和分頁保持可抓取,保證詳情頁有一條稳定的發現路径。
- 辅助頁和參數頁统一收口,不要在 robots、meta、canonical 多個层面重复設定相互冲突的指令。
- 收錄發生變化时,先確認是哪一類頁面在變,再去找原因,避免動辄做全站范围的大調整。