網站收錄

收錄都集中在首頁和列表頁,詳情頁迟迟不進索引:按這個顺序排查

站点索引量在涨,但收錄几乎都是首頁、栏目頁和列表頁,真正有内容的詳情頁進不去。這通常不是爬虫“不喜欢”這個站,而是入口、抓取分配和頁面质量叠加的结果。本文给出按頁面類型分组、查發現路径、看抓取占比與渲染差异的排查顺序,以及收敛低價值列表、补齐内鏈入口的具体動作。

網站收錄

收錄都集中在首頁和列表頁,詳情頁迟迟不進索引:按這個顺序排查

後台看到索引量在涨,点進去却發現几乎全是首頁、栏目頁、分頁列表和标簽頁,真正有内容的詳情頁寥寥無几。這種情况和“完全不收錄”是两回事,盲目重复提交 sitemap 或者加外鏈,往往解决不了問题。先要判断的是:收錄结构為什么失衡。

第一步:把收錄按頁面類型分组,而不是只看總量

把站内頁面分成几類:首頁與主要栏目、列表與分頁、标簽或聚合頁、詳情内容頁、功能與篩選頁。分別抽样統計收錄比例。如果詳情頁的收錄比例明顯低于列表頁,問题多半出在發現路径、抓取分配或模板质量上,而不是一句“爬虫不待见我的站”。

第二步:常见原因與對應表現

入口太窄,詳情頁只能靠列表頁被動带出

列表頁翻几頁就到头,每頁連結數量有限,新内容很快沉到深层;或者列表只加载第一屏,後面的内容靠点击“加载更多”触發,連結不是真實的 a 标簽。结果是爬虫能到列表頁,却看不到多少詳情連結。

模板撑起了頁面的大部分内容

詳情頁正文很短,而頁头頁脚、推荐位、侧栏、评论占了绝大部分篇幅,多個頁面之間的差异极小,就可能被当作低價值或高度近似頁面處理。检查方式很简單:把两三個頁面的正文單獨抽出来對比,看有效信息量究竟差多少。

列表頁消耗了大部分抓取

分頁、排序參數、篩選條件生成了大量可抓取 URL,爬虫每次来訪都在這些地址上打轉,留给詳情頁的次數自然就少了。這類地址通常不需要全部保留在索引里。

内容依赖客戶端渲染

頁面 HTML 源碼里没有正文,連結由脚本插入。抓取和渲染是两個阶段,渲染环节出問题时,頁面可能只被判成一個空壳。可以查看抓取到的 HTML 快照来確認。

第三步:一個可执行的排查顺序

  1. 抽样詳情頁,確認返回狀態碼正常,且没有被 robots.txt 或 meta 規則挡住。
  2. 確認這些頁面在站内有真實可点的連結入口,路径是否超過三四层。
  3. 看抓取日誌中各類型頁面的抓取占比,判断是否被列表類地址稀释。
  4. 检查 HTML 源碼中正文是否直接可见。
  5. 對比同模板頁面的内容差异度與信息完整度。

處理動作與观察方式

  • 把詳情頁入口前移:栏目頁首屏、相關内容模块、面包屑里给出稳定連結。
  • 收敛低價值列表:篩選參數、排序參數、翻頁過深的地址可以用 noindex 或規則過滤,但注意別把正常入口一起挡掉。
  • 补足頁面本身的信息:正文、结构化資料、图片說明、關联内容。
  • sitemap 只放真正希望被索引的詳情頁,並保持更新。

調整之後不要每天盯着索引數量變化。抓取和索引都有滞後,通常需要几周時間观察抓取比例和詳情頁收錄比例是否一起改善。如果抓取量上升、詳情頁收錄比例却不動,說明瓶颈不在抓取,而在頁面本身。

收錄结构失衡往往不是單一原因,而是入口、抓取分配和頁面质量叠加的结果。先定位主要矛盾,再逐項調整,比一次性大改更可控。