網站收錄

深层頁面迟迟不收錄,先检查内鏈路径是否走得通

頁面長期不收錄,内容之外還有一個常被忽略的原因:站内没有稳定的連結路径。本文從点击深度、連結形式、日誌核對几個角度,說明如何判断蜘蛛能不能走到深层頁面,以及修正内鏈入口时的次序和常见誤区。

網站收錄

深层頁面迟迟不收錄,先检查内鏈路径是否走得通

很多人處理收錄問题时,先想到的是改内容、提交 sitemap、加外鏈,却忽略了一件更基础的事:蜘蛛能不能沿着站内連結走到這個頁面。一個頁面如果長期只靠 sitemap 里的那一條记錄被看到,而没有稳定的内鏈入口,它的抓取優先級和重訪频率通常都不會理想。

URL 被發現之後,還需要一條能反复走的路

sitemap 负责“告诉”,内鏈负责“带路”。前者更像一次性的通知,後者是持續存在的通道。蜘蛛在正常爬行时主要靠連結扩散,如果某個頁面在站内没有任何連結指向它,它就成了孤岛頁面。孤岛頁面即使被抓取過,也容易很快被遗忘。

点击深度:從首頁到目标頁要经過几跳

点击深度是一個很直观的指标:用戶從首頁出發,点几次能到達這個頁面。深度越深,被抓取和重訪的概率通常越低。

  • 核心頁面尽量控制在三跳以内,能被導航、栏目頁或面包屑直接指到;
  • 内容頁至少要有栏目列表、相關推荐、上一篇下一篇中的一種入口;
  • 只在翻很多頁之後才出現的列表頁深處,通常需要額外匯總入口。

几種常见的“連結在,但路断了”

  • JS 生成的連結:用 onclick 跳轉或前端路由生成的地址,如果没有對應的 a 标簽,蜘蛛未必能顺着走。
  • 需要交互才出現的連結:点击“展開更多”“加载更多”才渲染出来的入口,抓取时可能根本不存在。
  • nofollow 用得太宽:整块導航或栏目連結全加 nofollow,等于主動收窄了通道。
  • 篩選和參數頁吃掉入口:大量參數组合連結分散了爬行,真正的内容頁反而没被走到。
  • 图片或图标承载連結:連結只寫在图片上而不在 a 标簽里,或者被脚本拦截。

用日誌和索引狀態做一次核對

  1. 挑出長期未收錄的頁面,先在蜘蛛訪問日誌里查它是否被訪問過、訪問频率如何;
  2. 再查這些頁面在站内有多少條内鏈、分別来自哪些层級;
  3. 用抓取工具只開啟 HTML 抓取,確認連結能否在源碼中被识別;
  4. 對比入口頁面本身是否收錄,入口不收錄,下游更难被走到。

修正时的几個做法

先补最少的必要入口,而不是全站铺連結。常见有效的做法包括:在栏目頁做按時間或主题的匯總入口,在正文底部加同主题的相關内容模块,用面包屑把层級關系寫清楚,把關键入口固定在頁头或侧栏這類全站可见的位置。改完之後观察一段時間,看日誌里這些地址的訪問是否變多。

内鏈只解决“能不能被找到、能不能被走到”,不解决“這個頁面值不值得被收錄”。内容本身没有獨特價值时,把路修得再好,结果也有限。

不要為了收錄而過度内鏈

全站每頁都挂上几百條連結,或者在頁脚堆一批無關地址,反而會让重要連結被稀释,也容易被判定為異常。合理的做法是让連結關系與内容關系一致:相關的内容互相指向,重要的頁面有更多入口,次要的頁面也不至于断掉入口即可。