很多站点都有這样一批頁面:URL 层面很深,中間夹着三四层目錄,頁面本身是几年前做的,内容還算完整,却常年停在“已發現-尚未编入索引”。运营者反复提交 URL,變化不大。這種情况通常不是某個單一原因造成的,而要從外到内一层层核對。
第一步:先確認頁面到底有没有可走的抓取路径
搜尋引擎發現 URL 和抓取 URL 是两件事。提交或者出現在 sitemap 里,只能說明“被發現”,能不能被排上抓取,還要看這個地址在站内有没有稳定的入口。深层頁最典型的問题就是:站内几乎没有任何連結指向它。
- 在站内搜尋框或爬虫模拟工具里,看看從首頁出發要经過几次点击才能到達這個頁面。
- 检查指向它的連結是不是只出現在 sitemap、XML 文件或某個已经失效的舊列表頁里。
- 確認連結是普通的 <a href> 還是 JS 点击事件。後者對抓取的帮助有限。
如果從首頁到目标頁需要五次以上点击,而且中途没有分類頁、聚合頁做中轉,那抓取優先級自然靠後。先补一條能走通的路径,往往比反复提交更有效。
第二步:看一眼抓取预算被什么占住了
一個站点的抓取配額是有限的。如果站内同时存在大量參數组合頁、搜尋结果頁、日歷翻頁、空列表,抓取资源會被這些低價值地址吃掉,深层老頁面只能排在後面。
可以用服務器日誌按目錄統計一下抓取次數分布。常见的情况是,少數几個目錄吸走了大半抓取量,而你想推的那批頁面,几個月才被訪問一次。這时候要做的不是催抓取,而是先堵住無意义的抓取消耗。
第三步:核對這批頁面本身值不值得收錄
深层老頁面里混着几種不同的東西,需要分開看:
- 有獨立價值的頁面:讲的是具体問题,能獨立回答一個查询,和站内其他頁面不重复。這類值得补内鏈、理顺路径。
- 内容稀薄的頁面:只有几行說明、一張图,或者正文主要是模板字段拼接。這類即使收錄了也很难获得展示。
- 已经被新頁面替代的舊頁面:内容過时,新版本已经在另一個 URL 上。這时候要考虑的是合並或重定向,而不是硬推收錄。
把這几類分開,處理方式完全不同。對第二、三類頁面强行優化,收益很小,反而會繼續占用抓取预算。
第四步:检查規范信号是否互相打架
深层頁最容易出現的規范問题是:同一内容存在多個地址,而 canonical、内鏈、sitemap 三處的指向不一致。例如頁面上 canonical 指向自己,但内鏈都指向舊地址,sitemap 里又只寫了新地址。這種矛盾會让搜尋引擎在几個候選之間犹豫,收錄自然慢。
核對規范信号时,優先看這三處是否指向同一個 URL:頁面 head 里的 canonical、站内主要内鏈、sitemap 條目。三者不一致时,先统一,再谈推動收錄。
第五步:如果确實不值得留,就让它登出
有些深层頁面做出来只是歷史遗留,业務上早已不用。與其花力气让它進索引,不如让它安静地离開:
- 内容已被新頁面覆盖的,用 301 指向新地址,並在 sitemap 里移除。
- 没有替代内容的,返回 410 或 404,同时清理站内入口連結。
- 只對特定人群可见的舊頁面,加 noindex 並去掉内鏈。
索引里少一批没用的地址,剩下的頁面反而更容易被稳定抓取。
一個實操上的顺序建议
综合下来,處理深层老頁面时可以按這個顺序走:先看有没有可達的内鏈路径,再看抓取预算是否被別處占住,然後判断頁面本身的價值,接着统一規范信号,最後决定是推收錄還是做收敛。整個過程不必一次做完,但顺序尽量不要颠倒——先推收錄、後补内鏈,通常事倍功半。
需要提醒的是,即使以上都做對了,收錄时机仍由搜尋引擎决定,我們能控制的是把路径打通、把噪音降下来,让頁面處在一個更容易被抓取和被選擇的位置上。