搜尋抓取

移動優先抓取下的 URL 發現:移動版頁面里的連結才算數

搜尋引擎抓取與索引时越来越以移動版 HTML 為主要依據,移動端的導航、分頁和相關推荐如果被砍掉或改成脚本注入,URL 發現通道就會變窄。本文讲清三種移動實現方式的检查重点、可落地的自检動作,以及如何把移動版纳入日常巡检。

搜尋抓取

移動優先抓取下的 URL 發現:移動版頁面里的連結才算數

移動優先之後,蜘蛛先讀的是移動版

現在主流搜尋引擎在抓取和索引时,預設以移動版 HTML 為主要依據。PC 版頁面仍然會被抓取,但要發現新連結、理解頁面结构,很多环节先看移動版。也就是说,移動版里没有出現的導航、分頁和相關推荐,在 URL 發現這條鏈路上基本等于不存在。

這件事的麻烦之處在于:移動版通常是被“優化”過的那一版,空間小、元素少,减法做得越彻底,交出去的發現入口就越少。

移動版做减法时,最容易丢掉的几條通道

移動端屏幕窄,很多站点會给頁面做减法:導航收進汉堡菜單,相關阅讀只留三條,列表頁改成無限滚動。對用戶来说体驗可能更好,但對 URL 發現是另一回事。

  • 汉堡菜單:如果菜單展開後連結本来就寫在 HTML 里,蜘蛛一般能讀到;如果是点击後由脚本才插入 DOM,就容易被漏掉。
  • 無限滚動:只有用戶滚動时才請求後續資料,列表尾部的 URL 不會出現在首屏 HTML 里。
  • 相關阅讀被截断:深頁面的内鏈數量下降,被發現的概率也随之降低。
  • 移動版没有引用 Sitemap:或者 robots.txt 里誤屏蔽了移動版路径,等于主動關掉一條申报通道。

三種移動實現方式,检查重点不同

响應式布局

同一套 HTML,只是 CSS 断点不同,這類站点風險最小。重点看隐藏規則:用样式隐藏的連結,多數引擎仍會解析;用脚本把节点從 DOM 里移除的,就不一定了。

獨立移動域名

以 m 開头或類似结构的移動域,需要確認移動版有完整的導航與分頁、指向自身的規范地址,以及與 PC 版正确對應。如果移動版只保留了首頁和少量栏目,發現能力就被砍掉大半。Sitemap 里同样應包含移動版 URL,或按引擎要求标注對應關系。

動態服務,同一 URL 返回不同 HTML

服務端按 User-Agent 返回不同版本时,要小心別把移動版蜘蛛当成陌生客戶端拦下。部分 CDN 或 WAF 會按 UA 做限流,结果是移動版蜘蛛拿不到完整頁面,連結自然也就發現不了。

检查移動版發現通道是否完整的几個動作

  1. 用移動端 UA 抓取首頁和几個栏目頁,數一數返回 HTML 里有多少可点击連結,和 PC 版對比差异。
  2. 關掉脚本再抓一次,看導航、分頁、相關阅讀還剩多少。剩得太少,說明發現路径嚴重依赖脚本。
  3. 检查 Sitemap 是否包含移動版路径,robots.txt 是否誤屏蔽。
  4. 在服務器日誌里篩選移動蜘蛛的 UA,看它抓取的 URL 數量與桌面蜘蛛的比例,是否長期只停留在首頁和热门頁。
  5. 用渲染測試工具確認渲染完成後的 DOM 里确實存在連結节点。
判断标准可以简單一点:把脚本關掉,從移動版 HTML 出發還能不能走到你的重点新頁面。走得到,發現通道基本没問题;走不到,就该补一條静態内鏈或 Sitemap 入口。

把移動版放進日常巡检

不少站点的 PC 版内鏈结构做得不错,移動版却因為改版、AB 測試、模板差异慢慢退化。建议在周报里固定看两個數字:移動蜘蛛抓取的 URL 數量,以及新地址從發布到首次被抓的間隔。如果移動版抓取量明顯低于桌面版,而流量结构並非如此,通常說明移動版的連結通道出了問题。

最後提醒一句:這些調整只能提高 URL 被發現的概率,並不能保證收錄或排名。發現之後還有抓取预算、内容质量、重复度等环节,任何一环都可能让一個地址停在队列里。