很多人把“新頁面能不能被蜘蛛抓到”当成提交問题,于是反复提交 URL、反复刷新站点地图。但實际运营中更常见的情况是:頁面本身没問题,站点地图里也寫了,只是站内没有任何一條連結指向它。對蜘蛛来说,這個 URL 是“存在但走不到”的。
這類頁面通常被称為孤立頁面。它的麻烦不在于一定抓不到,而在于能不能被發現,取决于外部引用、站点地图的讀取频率等不受你控制的因素。把入口連結补回去,才是更稳的做法。
先弄清“發現路径”是怎么形成的
蜘蛛進入站点,一般從首頁或某個已知入口開始,顺着連結一层层往外走。它能走多遠,取决于你给的連結密度和层級安排。一條 URL 被發現,通常有這几條路:
- 導航、栏目頁、列表頁里的常規連結
- 正文里的上下文内鏈、相關推荐
- 面包屑、标簽聚合頁、归档頁
- 站点地图中列出的地址
- 外部站点或社交平台的引用
其中前三條是你能完全控制的。如果這几條都没有覆盖新頁面,剩下两條就變成“等”而不是“做”。
哪些頁面最容易變成孤立頁
孤立頁往往不是你故意造成的,而是流程里漏掉的一环。常见来源包括:
- 新栏目上线但没挂進導航:栏目建好了,入口還停在後台草稿狀態。
- 专题頁、活動頁只發了外鏈:站内没有任何入口,活動結束後就彻底沉默。
- 改版後舊入口被删:頁面還在,連結被新的模板替換掉了。
- 深层内容没有上游列表:文章發布了,但所属分類没有列表頁,或者列表頁只展示最近若干條。
- 分頁深處的内容:只在很靠後的翻頁里出現,實际很难被走到。
- 篩選、排序产生的组合地址:本身不该被当成獨立内容,却容易被誤当成新頁面。
一套可执行的自查流程
- 抓取一份站内連結图:用爬虫工具跑一遍站点,導出“被連結到的 URL”清單,和你實际的 URL 清單做差集。差集里那部分就是没有站内入口的頁面。
- 看入口深度:對重点頁面,记錄從首頁出發需要点几次才能到達。一般建议核心内容控制在三次点击以内,越深越容易被忽略。
- 對照服務器日誌:把近一段時間的蜘蛛訪問记錄按 URL 分组,观察哪些頁面長期没有訪問记錄。注意日誌只反映“来過没来過”,不能直接說明原因,但能帮你鎖定观察對象。
- 检查栏目與列表頁:確認每個内容分類都有可訪問的列表頁,且列表頁能覆盖到較早的内容,而不是只留最新几條。
- 確認站点地图與站内連結一致:站点地图里列了、站内却没入口的頁面,属于典型的高風險項。
修补时的几個原則
补連結,而不是堆連結
解决孤立頁最直接的办法是加内鏈,但不要為了加而加。合理的做法是把連結放在语境相關的位置:正文中提到相關主题时自然指向,栏目頁的推荐位按内容類型聚合。一次性在頁脚塞几十條連結,既不自然,也很难带来實际價值。
先判断這個頁面值不值得有入口
不是所有孤立頁都该救。如果它本来就是低质聚合、重复内容、過期活動頁,更好的處理方式是合並、重定向或者下线,而不是硬塞一個入口让它繼續留在索引里。入口是给有價值的内容准备的。
让入口長期有效
很多孤立頁是“补了一次又断掉”。所以把入口检查放進日常流程會更省事:新内容發布时確認它至少有一個站内連結;改版时保留舊入口或用重定向接住;栏目調整後回头看一眼原分類下的内容有没有失去入口。
URL 發現不是一次性的動作,而是站点结构長期维護的一部分。與其反复提交地址,不如先確認站内有一條路能走到它。
可以固定下来的一件小事
如果资源有限,至少保留一個习惯:每隔一段時間,把站点地图里的 URL 和站内實际被連結的 URL 做一次比對,看差集有没有變大。差集越小,說明你的内容越容易被發現;差集突然變大,通常意味着某次改版或者某個模板出了問题,這时候尽早排查,比等到抓取量下滑再回头找要容易得多。