頁面能被抓取,不代表會被索引。抓取只是把 HTML 取回,索引還要经過质量评估。很多頁面長期停在“已發現”或抓取後没有進入索引,原因不在 robots 或 sitemap,而在頁面质量本身。
先分清抓取與索引
抓取是蜘蛛訪問 URL 並下载内容;索引是搜尋引擎判断這個頁面是否值得放進可供检索的库。两者中間有一道质量门槛。低质、重复、信息量不足的頁面可能被正常抓取,但不會進入索引。因此,当發現頁面不收錄时,先看日誌確認是否抓取過,再回到頁面本身做质量自检。
頁面质量自检的五個维度
1. 正文完整度
把頁面当作用戶第一次訪問来看:核心内容是否直接可见?如果正文依赖点击、展開、登入或滚動加载才能出現,抓取到的 HTML 里可能只有框架。可以抽取纯文本,看正文段落是否完整、字數是否過少、關键信息是否在首屏附近。
2. 模板占比
導航、頁脚、侧栏、推荐位、相關阅讀、评论模板都算模板内容。如果這些区块加起来遠多于正文,頁面容易被判定為低质。自检时可以把頁面 HTML 按区块拆分,估算正文占整個可见文本的比例。正文占比過低的頁面,優先考虑精简模板或合並内容。
3. 内容獨特性
同一站点内,不同篩選參數、排序方式、分頁组合生成的頁面,往往只有少數條目不同。這類頁面即使能抓取,也可能因為近似重复而不被索引。可以把标题、正文前几段、主要列表項做分组,找出高度相似的一组頁面,再决定保留哪些、合並哪些、收敛哪些。
4. 用戶價值
問三個問题:這個頁面是否在回答一個明确的問题?标题與正文是否一致?用戶看完能否得到可操作的信息?如果頁面只是聚合了少量信息,或者标题承诺的内容正文没有提供,质量分通常不會高。
5. 站点整体质量
索引是站点級別的判断。如果大量頁面都是薄内容、重复内容或空壳頁,搜尋引擎會降低對整站的抓取與索引意愿。反過来,当低质頁面被收敛後,優质頁面的抓取和索引表現可能改善。所以自检不能只看單個頁面,也要看低质頁面在整站中的占比。
自检之後怎么處理
- 提升:补充正文、增加獨特信息、把關键内容放到可直接抓取的位置。
- 合並:把近似重复的頁面合並到一個主頁面,用規范标簽或重定向處理舊 URL。
- 收敛:對没有獨立價值的篩選頁、分頁、空壳頁,用 noindex 或 robots 規則减少索引压力。
- 观察:調整後不要立刻判断收錄结果,按頁面類型给一個观察窗口,记錄抓取频次和索引狀態變化。
记錄與观察窗口
做质量自检时,建议建一張表:URL、頁面類型、抓取時間、抓取狀態、索引狀態、正文占比、處理動作、观察日期。按周或按双周對比。不要因為一两天没變化就反复修改,频繁改動反而會干扰判断。
收錄不是單一開關,而是頁面质量、站点整体表現和抓取配額共同作用的结果。先把质量门槛看清楚,再决定是優化、合並還是收敛。