很多站点的問题不是「蜘蛛不来」,而是蜘蛛来了、也抓了一批頁面,但有一部分 URL 始终等不到第一次訪問。這類頁面往往不是因為质量差,而是它在站内没有任何一條可被跟随的連結指向——也就是常说的孤儿頁面。理解孤儿頁面怎么产生,比反复提交 Sitemap 更有用。
孤儿頁面在蜘蛛眼里是什么样
對搜尋蜘蛛来说,一個頁面被發現的路径大致只有两類:顺着連結爬到,或者從 Sitemap、提交接口等入口讀到。前者是常態,後者更像补充。如果某個 URL 只在 Sitemap 里出現,站内没有任何連結指向它,那么它的抓取優先級通常偏低,抓取节奏也會明顯慢于主干頁面。
更麻烦的情况是:這個 URL 曾经被連結過,後来因為改版、栏目下线、URL 規則變化,連結被删掉了,但頁面本身還在返回 200。對蜘蛛来说,它就像一個断掉的路口。
常见的几種成因
- 改版遗留:舊栏目整体下线,頁面文件還在,入口連結已经全部移除。
- 後台生成頁:商品頁、文章頁、标簽頁由系統批量生成,但前台没有列表或聚合入口。
- 只在 Sitemap 里:把 Sitemap 当成發連結的工具,站内從不做連結。
- 連結被屏蔽:指向它的連結被 nofollow 或被 robots.txt 屏蔽,蜘蛛看得到地址,却走不進去。
- 篩選後的深层頁:要满足若干條件才能到達,路径太長,蜘蛛通常走不到。
怎么確認哪些 URL 是孤儿
- 用全站爬取工具從首頁出發跑一遍,導出所有可到達的 URL。
- 把 Sitemap、後台資料库或 CMS 里的全部 URL 導出。
- 两個列表做差集,差集里的就是站内没有連結路径的頁面。
- 再拿服務器日誌對照,看這些 URL 有没有被抓過、返回什么狀態碼。
差集里數量多,不一定都要救。先看有没有搜尋需求、有没有轉化價值,再决定是补内鏈、做聚合入口,還是直接做 301 或 410 让它退场。
修复的優先顺序
- 有流量的頁面優先补内鏈:從相關的内容頁、列表頁、面包屑加回入口,锚文本用能說明頁面主题的词。
- 批量頁做聚合入口:标簽頁、专题頁、最新列表都能承担分發作用,比一條條加連結省事。
- 确實無價值的直接下线:返回 410 或 301 到最相關的替代頁,避免繼續占用抓取。
- Sitemap 保持准确:只放需要被發現的正式 URL,不要把已下线的舊地址繼續留在里面。
孤儿頁面很少是「蜘蛛不给面子」,多數时候是站内确實没有给它留入口。Sitemap 能补一部分,但补不了連結结构本身。
日常维護的小习惯
栏目調整、批量上下架、URL 規則變更之後,顺手跑一次可到達 URL 的對比,比等到抓取量下滑再回头查要省力得多。同时留意服務器日誌里那些「只被抓過一次就再没出現」的 URL,它們往往就是连接薄弱的信号。