網站收錄

頁面能抓取却不進索引:先做一轮頁面质量自检

许多頁面能被蜘蛛抓取,却長期停在“已發現”或抓取後不入索引。問题往往不在 robots 或 sitemap,而在頁面质量本身。本文给出一套可操作的自检清單,從正文完整度、模板占比、内容獨特性、用戶價值等维度判断頁面是否達到可索引门槛。

網站收錄

頁面能抓取却不進索引:先做一轮頁面质量自检

頁面能被抓取,不代表會被索引。抓取只是把 HTML 取回,索引還要经過质量评估。很多頁面長期停在“已發現”或抓取後没有進入索引,原因不在 robots 或 sitemap,而在頁面质量本身。

先分清抓取與索引

抓取是蜘蛛訪問 URL 並下载内容;索引是搜尋引擎判断這個頁面是否值得放進可供检索的库。两者中間有一道质量门槛。低质、重复、信息量不足的頁面可能被正常抓取,但不會進入索引。因此,当發現頁面不收錄时,先看日誌確認是否抓取過,再回到頁面本身做质量自检。

頁面质量自检的五個维度

1. 正文完整度

把頁面当作用戶第一次訪問来看:核心内容是否直接可见?如果正文依赖点击、展開、登入或滚動加载才能出現,抓取到的 HTML 里可能只有框架。可以抽取纯文本,看正文段落是否完整、字數是否過少、關键信息是否在首屏附近。

2. 模板占比

導航、頁脚、侧栏、推荐位、相關阅讀、评论模板都算模板内容。如果這些区块加起来遠多于正文,頁面容易被判定為低质。自检时可以把頁面 HTML 按区块拆分,估算正文占整個可见文本的比例。正文占比過低的頁面,優先考虑精简模板或合並内容。

3. 内容獨特性

同一站点内,不同篩選參數、排序方式、分頁组合生成的頁面,往往只有少數條目不同。這類頁面即使能抓取,也可能因為近似重复而不被索引。可以把标题、正文前几段、主要列表項做分组,找出高度相似的一组頁面,再决定保留哪些、合並哪些、收敛哪些。

4. 用戶價值

問三個問题:這個頁面是否在回答一個明确的問题?标题與正文是否一致?用戶看完能否得到可操作的信息?如果頁面只是聚合了少量信息,或者标题承诺的内容正文没有提供,质量分通常不會高。

5. 站点整体质量

索引是站点級別的判断。如果大量頁面都是薄内容、重复内容或空壳頁,搜尋引擎會降低對整站的抓取與索引意愿。反過来,当低质頁面被收敛後,優质頁面的抓取和索引表現可能改善。所以自检不能只看單個頁面,也要看低质頁面在整站中的占比。

自检之後怎么處理

  • 提升:补充正文、增加獨特信息、把關键内容放到可直接抓取的位置。
  • 合並:把近似重复的頁面合並到一個主頁面,用規范标簽或重定向處理舊 URL。
  • 收敛:對没有獨立價值的篩選頁、分頁、空壳頁,用 noindex 或 robots 規則减少索引压力。
  • 观察:調整後不要立刻判断收錄结果,按頁面類型给一個观察窗口,记錄抓取频次和索引狀態變化。

记錄與观察窗口

做质量自检时,建议建一張表:URL、頁面類型、抓取時間、抓取狀態、索引狀態、正文占比、處理動作、观察日期。按周或按双周對比。不要因為一两天没變化就反复修改,频繁改動反而會干扰判断。

收錄不是單一開關,而是頁面质量、站点整体表現和抓取配額共同作用的结果。先把质量门槛看清楚,再决定是優化、合並還是收敛。