做站内巡检时偶尔會發現一類 URL:它确實在站点上,能正常打開,但站内任何一個頁面都没有指向它的連結。只能靠站点地图、外部連結或者歷史记錄找到它。這類頁面常被称為「孤儿頁面」或零内鏈頁面。它們不算错誤,但發現和收錄的路径與普通頁面差別明顯。
零内鏈頁面通常是怎么出現的
- 栏目改版或商品下架後,入口頁面被删掉,目标頁還留在服務器上。
- 活動頁、专题頁上线时靠首頁横幅临时導流,活動結束後横幅撤掉,頁面没人再鏈。
- 頁面只能通過站内搜尋、篩選參數或表單跳轉到達,没有静態入口。
- 頁面本来是投放落地頁,靠外部連結引入,站内從未做過入口。
- 站点地图里保留着地址,但模板里忘了加連結。
這几種情况的共同点是:頁面本身可能没問题,問题出在站点结构上少了一條到達它的路。
發現路径和收錄路径不是一回事
搜尋引擎發現 URL 的方式主要有几類:抓取已有頁面时顺着連結發現、讀取站点地图、接收提交接口或手動提交的地址、從外部連結跳到该地址。零内鏈頁面基本只能走後面几條。
但被發現只是進入候選队列。之後還要判断這個 URL 值不值得抓、抓回来以後值不值得進索引。相比有内鏈的頁面,零内鏈頁面少了两類信号:一是站内連結带来的上下文和重要性提示,二是「這個頁面在站内處于什么位置」的判断依據。在抓取配額有限的情况下,一组内容相近的 URL 里,有入口的通常更容易被優先處理。
所以经常出現這種情况:日誌里能看到抓取记錄,索引狀態却長時間没變化。這时候要看的不是「有没有被抓」,而是「抓完之後缺少什么」。
哪些零内鏈頁面值得留
不是所有零内鏈頁面都要救。動手前先分類:
- 仍有搜尋需求、内容完整的頁面:值得补入口。
- 临时活動頁、已過期頁面:考虑 301 到相關頁面,或直接下线。
- 重复内容頁、參數頁:合並或規范到主 URL。
- 纯内部使用的頁面:確認是否需要 robots 限制或訪問權限。
自查與补救顺序
- 用爬虫工具跑一遍全站,導出「被連結到的 URL」清單。
- 把這份清單與站点地图、日誌里的 URL 清單做差集,差集就是候選的零内鏈頁面。
- 逐個確認返回狀態碼、canonical 指向和正文是否有實质内容。
- 判断頁面是否還需要存在。不需要的走 301 或 410。
- 需要的頁面,找一到两個语义相關的上級頁面加入口連結,锚文本用頁面主题词,不要寫「点击這里」。
- 確認站点地图里保留该 URL,並检查站点地图本身是否被正常抓取。
- 之後观察日誌中该 URL 的抓取记錄,以及索引狀態是否發生變化。
补内鏈时可以考虑的位置
- 同類内容的相關推荐、上下篇導航。
- 栏目列表頁或归档頁。
- 面包屑與分類路径。
- 正文中自然提及该頁面时的锚文本。
几個容易搞混的点
站点地图不等于内鏈。它帮助發現地址,但不传递頁面在站内的位置關系,也不代表頁面重要。外鏈也不等于内鏈,一條外鏈能让爬虫找到頁面,可頁面在站内依舊是孤立的,後續内容更新很难被及时重新抓取。
另外,頁面放進站点地图却長期没有抓取记錄,不一定是被屏蔽,也可能是队列排期問题,需要结合狀態碼、robots 和服務器日誌一起判断,不要只凭一條狀態下结论。
處理零内鏈頁面的價值,通常不在于立刻让它被收錄,而在于理清站点里哪些 URL 其實已经没有入口,需要保留還是收口。
把零内鏈頁面当成站点结构的常規体检項,隔一段時間查一次差集,比等到流量下滑再回头翻日誌省事得多。處理时先判断頁面该不该留,再考虑入口怎么补。