網站收錄

孤立頁面長期不被收錄:先补站内入口,再谈提交

有些頁面發了、sitemap 也提交了,日誌里却几乎看不到蜘蛛来訪,問题常常不在搜尋端,而在站内没有連結指向它。本文讲清孤立頁面的常见形態、sitemap 替代不了内鏈的原因、用日誌和爬虫找出孤立 URL 的方法,以及补内鏈的實操顺序和补了也没用时的排查方向。

網站收錄

孤立頁面長期不被收錄:先补站内入口,再谈提交

经常有人遇到這種情况:新頁面發了,站点地图也提交了,主動推送也做了,但過了一两個月,搜尋蜘蛛依然没来抓過。翻服務器日誌會發現,這個 URL 除了上线那天被訪問過一次,之後几乎没有抓取记錄。多數时候,問题不在搜尋端,而在站内——這個頁面在站内是“孤立”的,没有別的頁面指向它。

什么算孤立頁面

孤立頁面不是指頁面打不開,而是指從一個正常入口出發,顺着連結走不到它。常见形式有几種:

  • 只存在于 sitemap 里,站内没有任何連結指向;
  • 只能通過站内搜尋或篩選结果才能到達;
  • 只能從首頁某個轮播位点進去,轮播換掉後就没入口了;
  • 列表頁只顯示最近若干條,老頁面被挤出列表後再無入口;
  • 只在 JS 彈窗或客戶端里出現,HTML 源碼里没有 a 标簽。

這些頁面對用戶也许還能訪問,但對爬虫来说,它們缺少一條被發現的路径。

sitemap 提交了,為什么還是不来

sitemap 的作用是提示存在,不是保證抓取。搜尋端會综合判断一個 URL 值不值得抓、什么时候抓、抓多少。当一個 URL 在站内没有任何引用时,它通常會被排在抓取队列的後面:既没有内鏈带来的上下文,也没有更新信号,優先級自然低。

反過来,如果一個 URL 被多個重要頁面稳定連結,它同时获得三样東西:發現路径(蜘蛛顺着連結走到這里)、上下文(周围文字告诉它這個頁面讲什么)、更新信号(連結所在頁面更新时可能被重新抓取)。這三样是 sitemap 單獨给不了的。

找出孤立頁面的几個办法

  1. 對比清單:把 sitemap 里的 URL 和站内實际被連結的 URL 各導一份,做差集,差集里的就是候選。
  2. 翻服務器日誌:只看蜘蛛 UA 的记錄,找出從未被抓和只被抓過一次的 URL,按目錄归類。
  3. 用爬虫工具跑全站:從首頁出發爬一遍,看哪些 URL 只出現在 sitemap 里、爬不到。
  4. 站内搜尋兜底:如果只能靠站内搜尋到達,基本可以判定是孤立頁面。

补内鏈的實操顺序

先补最重要的那几條,不必追求一次铺满。

  • 面包屑和分類導航走一遍,確認新頁面挂在正确的分類下;
  • 在同類内容里加相關阅讀,優先從已经被抓得比較勤的頁面往外鏈;
  • 列表頁做归档入口,不要把老頁面只放在“最新”列表里;
  • 更新几篇老文章,在里面自然提到新頁面並加連結,往往比在新頁面里堆外鏈更有效;
  • 首頁或栏目頁给核心頁面留一個稳定入口,不要放在會轮換的运营位里。

連結文字尽量描述頁面主题,別统一寫“点击這里”。补鏈之後,可以再观察一两周日誌里的抓取记錄變化,而不是当天就下结论。

内鏈也救不了的情况

补完連結後如果還是没動静,要回头查這几項:頁面是否被 robots.txt 挡住、是否带了 noindex、是否返回非 200 狀態、内容是否與站内其他頁面高度重复、是否整頁靠 JS 渲染而源碼里几乎没内容。這些属于硬性拦截或质量問题,内鏈解决不了。

也有站点會尝试用蜘蛛池之類的办法增加来訪次數。但如果發現路径本身就缺失,抓取机會再多,也更多是重复消耗在已知頁面上,孤立 URL 依然排不上队。

内鏈提高的是被抓到的机會,不等于收錄。最终是否進入索引,仍取决于頁面本身的质量和搜尋端的判断。

小结

做 URL 發現,先看站内有没有路,再看提交和推送。孤立頁面的問题往往不是提交得不够多,而是站内没给它留位置。把入口补齐、把相關連結做起来,通常比反复提交更管用;剩下的,交给時間和頁面质量。