什么算孤儿頁面
孤儿頁面指的是站内没有任何連結指向它的 URL。它可能存在,也可能有内容,但用戶和蜘蛛都只能通過外部連結、sitemap 或手動提交的地址才能到達。對搜尋引擎来说,這類 URL 缺少上下文,既不知道它和哪些頁面相關,也很难判断它该隔多久回訪一次。
常见的孤儿頁面包括:早期做活動留下的落地頁、測試环境誤發布到线上的目錄、批量生成的商品或文章頁、被下架但没刪除的舊地址,以及改了導航之後忘了补連結的老栏目。
蜘蛛發現 URL 的几條路径
- 站内連結:從首頁、栏目頁、正文里的連結一层层爬過去,這是最主要也最持續的路径。
- sitemap:相当于一份提交清單,蜘蛛會定期讀取,但讀到不代表马上抓,也不代表會收錄。
- 外部連結:別的站点鏈過来,蜘蛛顺着爬進来,通常只對被發現那一次起作用。
- 手動提交或 URL 检查工具:适合新頁面第一次曝光,量小,不能当日常手段。
- 歷史记錄:以前抓取過的 URL,會按一定的回訪节奏再来看,間隔通常比内鏈頁面長。
這几條路径里,只有内鏈是稳定、可预期、能反复触發的。其他方式更像一次性投递。
孤儿頁面為什么容易被落下
抓取资源是有限的。蜘蛛在一個站上花的時間,會優先分配给入口清晰、被多次連結、歷史表現稳定的頁面。一個没有内鏈的 URL,既不在主要路径上,也没有来自其他頁面的關联信号,自然排在後面。
结果往往是:提交之後很長時間没有動静,或者抓了一次就很少再来。内容更新了也难以及时被抓到,收錄狀態自然不稳定。
怎么找出站内的孤儿頁面
- 用爬虫工具整站抓一遍,把抓取到的 URL 列表和 sitemap 里的 URL 列表做差集,只在 sitemap 里出現、爬虫爬不到的那些基本就是孤儿。
- 看服務器日誌,篩選出有抓取记錄但站内找不到入口的地址,這類通常是外部連結带進来的。
- 在站内搜尋里搜几個只属于该頁面的關鍵詞,如果站内都搜不到,說明它没有被纳入任何聚合或列表。
- 检查栏目頁和列表頁的分頁,很多内容其實是卡在第 3 頁之後没人点,逐渐變成事實上的孤儿。
處理方式
- 值得留的頁面:從相關的正文、相關推荐、专题頁里补上連結,让蜘蛛有路径可以走到。
- 内容單薄但主题相近的頁面:合並成一個頁面,把零散内容整理到一處,而不是勉强给每個都补連結。
- 已经下架、没有用戶價值的地址:直接返回 404 或 410,比留在那儿当孤儿更清楚。
- 确實無法放進導航的頁面:至少寫進 sitemap,並接受它的抓取和回訪节奏會比内鏈頁面慢。
内鏈是蜘蛛日常巡站的路线图,sitemap 更像一份提交清單。清單可以提交,路线才决定它多久来一次。
补内鏈时的几個细节
补連結不是随便堆几個地址就完事,下面几点更容易见效:
- 锚文本:用能概括頁面主题的词,而不是“点击這里”“更多”。
- 連結位置:正文中的連結通常比頁脚、侧栏的批量連結更被看重。
- 来源相關性:從同主题頁面鏈過去,比從首頁導航随便挂一個更有意义。
- 數量控制:一個頁面被几個真正相關的頁面連結,通常比被几十個無關頁面挂上更合理。
- 层級:尽量让重要内容從首頁出發三到四次点击就能到達,离入口太遠的頁面回訪間隔會明顯拉長。
孤儿頁面不是必须消灭,但要知道哪些是主動保留、哪些是被遗忘的。定期做一次入口梳理,比事後反复提交地址更省事。