站点查询出来的收錄數字只是一個粗略信号。它可能混進一些你並不想要的 URL,也可能漏掉一部分其實已经進索引的頁面。所以当它看起来“很少”时,第一步不是去改内容,而是先確認:到底是整体都没被收錄,還是某几類頁面被系統性地排除在外。
先按目錄拆開看
用 site: 查询逐個目錄试一遍:首頁、主要栏目、文章詳情、标簽頁、搜尋頁、用戶中心路径。记錄每個目錄下大致有多少頁面、能被查出来多少。多數站点會呈現明顯的分层:
- 首頁和一級栏目基本都在;
- 詳情頁收了一部分,越老的越容易被收;
- 某個目錄几乎全军覆没,比如 /search/、/tag/、/user/。
如果某個目錄整体缺席,問题通常不在單篇内容的质量,而在這一层 URL 的生成方式和入口设計。
再按模板分组
同一個目錄里,不同模板的頁面表現也會差很多。比如文章頁和专题頁共用一個栏目,但文章頁收得很少、专题頁收得不错,那問题大概率出在文章頁模板上。按模板分组时,重点看三件事。
入口够不够
每個頁面從首頁出發要点几次才能到達?如果只能靠 sitemap 或者站内搜尋進入,蜘蛛能發現,但缺乏持續爬取的動力。列表頁翻頁是否正常輸出連結、相關推荐是否為静態連結,都影响這一层。
模板本身是否重复
大量頁面除了标题和正文之外,其余区域完全一致,包括導航、推荐位、评论占位、頁脚連結。這類頁面在算法眼里区分度很低,收一部分、丢掉一部分是常见结果。做模板分组时,可以用两三個頁面的正文比例、唯一文本字數做對比。
内容是否真的獨立
聚合頁、标簽頁、分頁的摘要頁容易扎堆。它們不是低质,但同质化嚴重,收進来對用戶帮助有限。這類頁面的取舍可以單獨定規則,不必和詳情頁绑在一起處理。
把“抓了没收”和“没抓”分開
服務器日誌能回答一個關键問题:蜘蛛到底来没来過。如果某個目錄的 URL 在日誌里几乎不出現,說明卡在發現和調度环节,改内容没用;如果日誌里频繁出現、狀態碼 200、HTML 也正常輸出,但迟迟不進索引,那才轮到内容和质量层面的判断。這一步分清楚,後面的動作才不會白做。
抓取次數多不代表收錄會跟上,收錄少也不代表蜘蛛没来。這两個指标分開看,排查方向會清晰很多。
處理顺序建议
- 先修入口:把重要頁面挂到有實际抓取频率的列表頁上,保證連結是普通的 a 标簽,而不是脚本点击後才生成。
- 再修模板:拉開同類頁面的区分度,减少全站统一的模块占位,让正文成為頁面主体。
- 最後動内容:确實没有獨立價值的頁面,合並到更有代表性的頁面上,或者用 noindex 明确登出索引,而不是放着不管。
观察节奏
調整之後不要每小时看一次收錄數。指數級的收錄變化通常以周為單位,索引报告里的數字也有延迟。建议固定一個观察周期,比如每两周记錄一次各目錄的收錄比例,看趋势而不是看單点。如果比例在缓慢回升,說明方向對;如果三四周毫無變化,就回到入口和模板這两层再检查一遍。
最後提醒一句:收錄數量本身不是目标。真正要盯的是“该被收錄的頁面有没有被收錄”,剩下的部分,留在索引外邊反而是更干净的结果。