做收錄管理的人常有一個习惯:打開查询指令看一眼數字,涨了就安心,跌了就慌。但收錄數本身没有统一的比較基准,不同站点的结构、頁面体量、歷史都不一样。更有意义的做法是定期做一次“体检”:不是看有多少頁面被收錄,而是看被收錄的頁面是不是你想要的那一批,没被收錄的又卡在哪一环。
第一步:先把 URL 按角色分组
收錄問题几乎不會均匀分布在整站,它總是集中在某一類 URL 上。所以在看資料之前,先把站内 URL 分成几组:
- 内容頁:文章、商品、問答等有獨立主题的頁面;
- 栏目與列表頁:承担導航和分發;
- 聚合與标簽頁:由站内词條、标簽自動生成;
- 參數與篩選頁:排序、篩選、追踪參數拼接出来的地址;
- 分頁與站内搜尋结果頁;
- 纯功能頁:登入、註冊、购物车、提交成功頁。
分组之後再看抓取與索引狀態,問题往往會立刻顯出轮廓:如果没被收錄的几乎全是參數頁,那這是一個 URL 管理問题;如果连内容頁也大量缺席,才需要回头怀疑站点结构或内容质量。
第二步:抓取狀態和索引狀態要分開看
用搜尋指令能看到的只是索引结果的一個近似值,它既不精确,也不告诉你頁面卡在哪一步。相對可靠的做法是三份信息交叉對照:服務端日誌里蜘蛛的訪問记錄、搜尋後台里各類頁面的抓取與索引資料、以及针對性的抽样查询。
一個頁面可能被抓了很多次却始终没進索引,也可能進了索引却早已内容過期。抓取、收錄、展現是三個不同的环节,混在一起看,结论一定是错的。
抽样时不要只抽首頁和热门頁,那批頁面通常狀態最好。按分组各抽十几個 URL,覆盖新發布的、久未更新的、内鏈少的、參數多的,才容易看到真實分布。
第三步:判断一個頁面值不值得留在索引里
收錄不是越多越好。一個頁面留在索引里,至少要满足下面几條中的大部分:
- 它有自己的主题,不是別處内容的拼接或複製;
- 它回答了某個具体問题,或者提供了某件具体的信息;
- 站内有正常的入口,蜘蛛不需要靠 sitemap 才能發現它;
- 模板部分没有压過正文部分的比例;
- 它能長期存在,而不是下周就失效。
按這几條筛下来,通常會有一批頁面被判為“不该被收錄”:只剩一两條结果的标簽頁、只有篩選條件不同的列表頁、内容全靠引用其他頁面的聚合頁、以及反复變動的临时地址。它們留在索引里,既拉低整站的质量判断,也浪費抓取资源。
處理方式要分開用
- 内容确實重复:考虑合並成一個頁面,或者保留主版本並用規范化标簽指向它;
- 頁面有價值但不该單獨收錄:用 noindex 明确表態,同时不要用 robots.txt 挡住抓取——挡住抓取,蜘蛛就看不到 noindex;
- 纯功能頁和站内搜尋结果:用 robots.txt 挡抓取通常就够,因為它們本来也不指望被收錄;
- 已经收錄但要清出去:先改頁面的索引指令,再移除站内入口,剩下的交给時間,不要指望一次操作立刻生效。
第四步:把结论落回具体頁面和具体動作
体检报告如果只寫“收錄率偏低”,基本没有用。可执行的结论應该長這样:某類參數頁共约多少條,站内連結情况如何,下一步是加 noindex 還是收敛入口;某個栏目的詳情頁抓取正常但未收錄,需要检查正文是否為模板填充、是否有内鏈支撑。
把這些结论拆成两類動作會比較清晰:一類是减少——收敛不该被發現的 URL,让蜘蛛把時間花在有用的頁面上;一類是增强——给真正的重点頁面补内鏈、补更新、补结构,让它們更容易被重复訪問。
多久做一次,以及几個常见誤区
對内容更新频繁的站点,一個月一次比較合适;更新节奏慢的站点,季度一次也够。重点不是频率,而是每次看的是同一批分组指标,這样才看得出變化。
- 不要把收錄量当成考核指标,為了數字放開全站收錄,只會让索引里堆满低價值頁面;
- 不要用“收錄慢”解释所有問题,先確認頁面本身是否值得被收錄;
- 不要一邊用 robots.txt 挡抓取,一邊期待頁面因為 noindex 而消失;
- 不要指望某一次調整立刻见效,索引的更新有自己的节奏。
收錄這件事,本质上是在和蜘蛛做長期的信息交換:你告诉它哪些頁面重要、哪些可以忽略,它用抓取和索引来回應。体检的作用,就是定期检查這场交換有没有走偏。