排查收錄問题时,很多人的第一反應是查蜘蛛有没有来、sitemap 有没有提交。抓取通道確認無誤之後,剩下的問题往往就落到頁面本身:同样的抓取频次,為什么有的頁面進了索引,有的却一直停在门外。這篇文章把“頁面质量”拆成四個可以自己動手查的维度,帮你在改代碼之前先把方向定下来。
一、先分清抓取與收錄:蜘蛛来過只是入场券
抓取是搜尋引擎拿到頁面内容的過程,收錄是它判断這個頁面值得放進索引、並准备好對外展示的過程。两者之間那道门槛,主要看頁面能不能提供獨立、可解释、對用戶有用的信息。所以当日誌顯示蜘蛛频繁訪問却迟迟不進索引时,通常不是抓取問题,而是頁面本身让搜尋引擎判断它不值得單獨占一個位置。
二、维度一:正文占比是否過低
把源碼里的導航、侧栏、推荐位、评论、頁脚都划掉,剩下的正文還剩多少,這是最直观的判断方式。如果一個頁面正文只有两三行,其余全是模板和推荐,它在质量维度上就很吃亏。常见的几類:
- 列表頁、标簽頁、篩選頁的正文稀薄
- 空结果頁、無内容占位頁
- 只有一張图或一段视频,没有任何文字說明
處理方式不是把所有模板都删掉,而是判断這個頁面有没有獨立價值。没有的话,考虑合並、設定 noindex,或者让它在站内被合理收敛。
三、维度二:内容是否唯一
重复内容不會直接導致站点被處罚,但它會让搜尋引擎在多個相似 URL 里只挑一個,其余的自然進不了索引。常见的有三種:
- 完全重复:同一份内容複製到不同 URL,比如带參數和不带參數的版本
- 近似重复:标题不同但正文高度雷同,多出現在批量生成的頁面
- 聚合重复:聚合頁把詳情頁内容整段搬過来,没有自己的整理和判断
前两種靠 canonical、URL 規范化和參數處理收敛;第三種要先問自己:這個聚合頁除了搬运,還提供了什么。如果答案是否定的,它被排除在索引外就是正常结果,不必强行對抗。
四、维度三:URL 是否能被稳定识別
URL 規范看似是技術细节,實际會影响收錄判断。大小寫混用、末尾斜杠两種寫法並存、index.html 與目錄地址同时可訪問,都會让同一個頁面出現多個入口。搜尋引擎需要花時間判断它們是不是同一個頁面,這個過程本身就會拖慢收錄。
比較稳的做法是:站内連結统一寫成一種形式,其余形式做 301 跳轉,canonical 指向最终地址,並且不要指向 404、noindex 或跳轉鏈上的地址。
五、维度四:頁面能不能自證價值
最後一层是内部和外部的信号。一個刚上线、没人連結、内鏈也進不去的頁面,搜尋引擎缺少判断依據,收錄自然慢。可以從這几處补:
- 從相關栏目頁、詳情頁加内鏈
- 相關頁面之間互相引用
- 有真實分享或外部引用时,頁面更容易被识別
這里说的是提高被發現的概率、补充判断依據,而不是保證收錄。
如果一個頁面在内容、唯一性、URL、内鏈這四個维度上都站得住,收錄慢通常只是時間問题;如果其中两三個维度都有明顯短板,反复提交 sitemap 也很难改變结果。
六、動手前的自查顺序
- 先從日誌確認蜘蛛是否来過,排除抓取层面問题
- 检查该頁正文占比,判断是不是空壳頁
- 在站内搜一段正文,看有没有近似重复的頁面
- 检查 URL 變体是否已收敛到唯一地址
- 检查有無内鏈入口,頁面能否從首頁几跳内到達
- 最後再决定是優化、合並,還是直接收口
收錄問题很少由單一原因造成。按這個顺序走一遍,多數情况下能在動手改之前先把方向定下来,避免在抓取通道上反复折腾,却始终没碰到真正的問题。