網站收錄

收錄比例按目錄拆開看:栏目頁與詳情頁失衡时的排查顺序

用 site: 看到的收錄量只是一個總數,真正的問题常藏在不同目錄之間。本文给出按目錄抽样、對照抓取记錄與 Sitemap 的核對方法,並列出栏目頁與詳情頁收錄失衡时的常见原因和處理顺序。

網站收錄

收錄比例按目錄拆開看:栏目頁與詳情頁失衡时的排查顺序

用 site: 查收錄量,得到的通常只是一個總數。總數涨跌背後,真正的問题往往藏在目錄结构里:栏目頁大面积不入索引,詳情頁却收錄正常;或者新上线的目錄几乎零收錄,老目錄却一直增長。把收錄比例按目錄拆開看,比盯着一個總數更容易定位原因。

為什么按目錄拆比看總數有用

同一個站点的不同目錄,模板、内容厚度、内鏈位置、更新频率都可能完全不同。混在一起統計,問题目錄的異常會被其他目錄的數字掩盖。按一級或二級目錄分组,可以直观看到每個目錄的收錄情况大概處在什么水平。

這里说的比例不需要精确到個位,抽样估算就足够支撑判断。重点不是算出一個數字,而是找出明顯低于同站其他目錄的那一组。

抽样怎么抽

  • 每個一級目錄抽 20 到 50 個 URL,尽量覆盖列表頁、詳情頁和分頁
  • 用 site: 加目錄前缀做粗略查询,结果只作參考,不作為精确值
  • 對照抓取日誌或抓取統計,確認這些 URL 是否被抓過、抓了几次
  • 對照 Sitemap,確認這些 URL 是否出現在提交列表里

四组資料放在一起,基本能区分出“没被抓”“抓了没收”“收了被替換”這几種情况。

三類最常见的目錄失衡

栏目頁大量未收錄

列表頁内容靠标题堆叠,正文信息少,同一栏目的多個分頁又高度相似。這類頁面對搜尋引擎来说價值偏低,即使被抓取,也往往只入索引一小部分。可以先检查分頁是否重复、是否带大量排序參數,以及列表里有没有足够的差异化說明文字。

詳情頁收錄正常,栏目頁几乎不收

常见原因是詳情頁被内鏈大量指向,而栏目頁只出現在導航或面包屑,入口單一。另一個原因是栏目頁本身没有獨立内容,只是詳情頁的集合,搜尋引擎更倾向于直接收錄詳情頁。若栏目頁确實没有獨立價值,收敛一部分比强行让它收錄更合理。

新目錄几乎零收錄,老目錄持續增長

先確認新目錄有没有被抓取過。如果抓取记錄都很少,問题多半在發現路径:内鏈入口太少、层級太深、Sitemap 没更新。如果抓取了却没收錄,則更可能是内容质量或與其他目錄重复度偏高。

建议的排查顺序

  1. 確認目錄没有被 robots.txt 或頁面級 robots 指令拦截
  2. 看抓取记錄:有没有抓、抓取频次是否明顯低于其他目錄
  3. 看内容:是否與其他目錄模板高度重复,是否只是列表堆叠
  4. 看内鏈:從首頁到该目錄下頁面的点击距离是几层,入口有几個
  5. 看 canonical 與 URL 規范:是否出現同一内容多個地址互指的情况
  6. 看 Sitemap:目錄下的 URL 是否被完整提交,是否混入了不该提交的參數頁

這個顺序的原則是:先排除“被明确拦掉”,再排除“没被發現”,最後才讨论内容值不值得收錄。顺序反過来做,很容易在内容上反复修改却看不到變化。

拆開之後可以做的几件事

  • 补入口:给收錄差的目錄增加合理的内鏈位置,而不是在全站頁脚堆連結
  • 做收敛:没有獨立價值的篩選頁、分頁、空列表,用規范方式归並或限制提交
  • 补内容:栏目頁加一段說明或選取規則,让它和纯列表区分開
  • 分清優先級:在同一次抓取预算下,先保證重点目錄的詳情頁和核心栏目頁
收錄比例是诊断工具,不是目标。為了把某個目錄的比例做上去而强行提交大量低價值 URL,通常只會让整体抓取效率更差。

多久看一次结果

調整内鏈或收敛 URL 之後,抓取和索引的反馈通常需要數周才趋于稳定。建议按周记錄各目錄的抽样比例,观察趋势而不是單日數字。如果连續几周没有變化,再回到抓取记錄,確認調整是否真的改變了抓取分布,而不是繼續在内容上反复改。