蜘蛛發現一個新 URL,通常只有两條路:顺着站内連結爬過去,或者從 Sitemap、外鏈、歷史提交里拿到地址。如果一個頁面在站内没有任何可点击的入口,它就只能靠後一條路被找到。這類頁面常被称為孤岛頁面。
孤岛頁面不一定會出問题,偶尔一两個無關紧要。但当數量變多,往往說明站内结构在某次改版、某次模板調整之後被切断了。值得收錄的内容接不上内鏈,抓取和重新抓取都會變得不稳定。
孤岛頁面是怎么出現的
大多數孤岛頁面不是刻意做出来的,而是流程里漏掉的一环。常见来源包括:
- 改版或換模板时,原有的栏目入口被删掉,頁面本身却保留了下来;
- 時間較久的文章,只存在于归档頁很深的分頁里,從首頁几乎点不到;
- 活動頁、专题頁下线後没有清理,連結撤了,頁面還在线;
- 自動生成的标簽頁或聚合頁,没有被任何列表引用;
- 只通過表單提交、站内搜尋或 JS 跳轉才能到達的詳情頁;
- 迁移时遗留的舊目錄頁面,入口在新结构里没有對應位置。
排查思路
排查的關键,是把「站内能爬到的 URL」和「站点實际存在的 URL」做一次對比。可以從几個方向入手:
- 全站爬取對比。用爬虫工具從首頁出發抓一遍,再和 Sitemap、資料库里的 URL 列表對照,差集里往往就是孤岛頁面。
- 看服務器日誌。如果某個頁面長期只有搜尋引擎来抓,几乎没有站内 referer,說明站内没有連結指向它。
- 抽样测点击距离。從首頁開始点,看重要頁面能否在几次点击内到達。超過四五层還找不到的,基本可以按孤岛處理。
- 检查相關推荐和面包屑。有时入口是有的,但只在某個版本或某個端上顯示,蜘蛛拿到的 HTML 里並没有。
治理时先分類,再動手
不是所有孤岛頁面都值得救。补内鏈之前,先判断頁面本身還有没有價值。
- 有獨立價值、還有搜尋需求的頁面:补内鏈。可以從相關文章、同栏目列表、专题聚合頁、面包屑等位置挂上去,让它重新回到連結網絡里。
- 已经過期或重复的頁面:该合並的做 301 指向新地址,该下线的返回 410 或加 noindex,不要繼續挂着。
- 數量多、價值低的自動生成頁:從源头關掉生成逻辑,比事後一個個补連結更省事。
- 深分頁里的老内容:可以考虑做按時間或按分類的索引頁,把入口前移。
补内鏈不是越多越好。為了救一個孤岛頁面,在正文里硬塞一堆無關連結,反而會让内鏈质量下降。入口只要自然、位置合理就够了。
把它變成日常動作
孤岛頁面容易在改版、換模板、批量下线内容之後集中出現。可以在發布流程里加一步確認:新頁面發布後,至少有一個站内入口指向它。另外每隔一段時間跑一次全站爬取,把「爬到的 URL」和「Sitemap 里的 URL」做一次差集,差异明顯變大时再回头查原因。
孤岛頁面本身不是错誤,但它是一個信号。數量少的时候可以逐個處理,數量持續增加,通常意味着栏目入口、归档结构或發布流程需要重新理一遍。