入口頁的作用是把 URL 送到搜尋蜘蛛面前。但很多运营者會遇到一個困惑:日誌里明明看到蜘蛛抓了目标頁,過一段時間去查,目标頁還是没進索引。這时候繼續加入口頁、加連結,通常不會有變化,因為問题多半不在入口頁,而在目标頁自身或者抓取之後的几個环节。
先把“發現、抓取、收錄”三件事拆開
- 發現:蜘蛛在入口頁里讀到目标頁 URL,進入待抓取队列。
- 抓取:蜘蛛真正請求了目标頁,服務器日誌會留下记錄。
- 收錄:搜尋引擎判断這個頁面值得進索引,並能出現在结果里。
入口頁最多只能推動前两步。第三步由目标頁和整站狀態决定,入口頁再怎么加也没法替代。把這三件事分清之後,排查才有方向。
抓取已经發生但收錄没發生:常见的几類卡点
1. 抓到的不是最终内容
如果目标頁正文由 JavaScript 渲染,蜘蛛第一次抓到的可能是空壳。它會不會再走一次渲染,取决于頁面重要性和渲染资源是否可用。判断方法:用抓取工具模拟不带 JS 的請求,看看返回的 HTML 里有没有正文和連結。如果關键内容只存在于 JS 里,考虑做服務端渲染或预渲染,至少保證首屏有可讀内容。
2. 頁面返回狀態不干净
软 404 是常见問题:HTTP 狀態碼是 200,但頁面寫的是“该内容不存在”“已下架”。這類頁面一般不會進索引。同样,内容极薄、大量模板重复、正文被折叠到需要交互才展開,都會让頁面在索引环节被放弃。
3. 規范标簽指向別的 URL
如果目标頁的 canonical 指向了另一個頁面,搜尋引擎會把這個 URL 的内容归到那個頁面上,它自己就不進索引。带參數、存在多份副本的 URL 尤其容易踩這個坑。检查时把目标頁自身的 canonical、站点地图里的寫法和站内連結指向的版本對照一遍,看是不是同一個地址。
4. 被 robots 規則或 meta 拦在索引之外
Disallow 影响抓取,noindex 影响收錄,两者拦的阶段不一样。還有一種情况是服務端根據 UA 返回不同内容,蜘蛛拿到的版本带着 noindex,而你自己在浏览器里看不到。這種情况要按蜘蛛 UA 去請求一次才能發現。
5. 頁面本身缺少值得收錄的信号
没有站内入口、没有外部引用、内容和其他頁面高度相似、主题和整站關系不大,這些都會让頁面停留在“抓過但不收錄”的狀態。這不算技術故障,靠加入口頁也解决不了。
建议的排查顺序
- 先在日誌里確認蜘蛛确實抓過目标頁,拿到抓取時間和返回狀態碼。
- 用不带 JS 的方式請求目标頁,看返回的 HTML 里有没有正文和有效連結。
- 检查 HTTP 狀態碼、canonical、meta robots、X-Robots-Tag 是否互相一致。
- 看目标頁内容是否和站内其他頁面高度重复,是否有獨立價值。
- 確認目标頁有正常的站内入口,而不是只靠蜘蛛池入口頁導過去。
- 以上都正常时,可以通過站点地图或提交接口把這個 URL 再提交一次,缩短重新判断的等待時間,但不要期待立刻有结果。
入口頁能做什么、不能做什么
入口頁擅長的是扩大 URL 的暴露面,让更多地址進入待抓取队列。它不擅長的是改變搜尋引擎對目标頁的價值判断。把入口頁數量翻倍,往往不如把目标頁的問题先修干净。
如果日誌顯示蜘蛛持續抓取目标頁但長期不收錄,優先怀疑目标頁本身,而不是繼續增加入口頁規模。
几個容易忽略的细节
- 目标頁在入口頁里的锚文本和周围文字,會影响蜘蛛對该頁主题的初步判断,但不會决定它收不收錄。
- 同一目标頁在多個入口頁重复出現,邊际收益递减,還會占用抓取額度。
- 目标頁如果是站外域名,入口頁能帮上的只是發現,收錄判断由那個站点自身的狀態决定。
- 抓取频率和收錄速度不是线性關系,抓得多不代表收錄得快。
入口頁解决的是“蜘蛛知不知道這個 URL”,收錄解决的是“這個 URL 值不值得進索引”。看到抓取却没收錄时,把注意力從入口頁挪到目标頁,按上面的顺序逐項排除,通常比繼續加連結更有效。