搜尋抓取

移動優先抓取:蜘蛛實际抓的是移動版還是桌面版

移動優先索引下,蜘蛛做内容判断时以移動版 HTML 為主。本文解释响應式、獨立移動域名、按 UA 動態下發這三種形態的抓取差异,說明移動版少正文、少内鏈會带来什么後果,並给出用移動 UA 自查的五個步骤和几處常见坑。

搜尋抓取

移動優先抓取:蜘蛛實际抓的是移動版還是桌面版

很多站点在改版时,會同时维護移動版和桌面版两套頁面。移動優先索引全面推開之後,蜘蛛在多數情况下抓取和评估的,是移動版 HTML,而不是你在电脑上看到的那一版。如果两邊内容不一致,蜘蛛记住的是移動版,而用戶可能看到的是桌面版,差异就會變成抓取和收錄上的麻烦。

移動優先並不等于“只看手机”

它解决的是同一套索引里用哪個版本作准的問题。蜘蛛仍然會抓桌面版,也會跟桌面版上的連結,但用于内容判断的主版本是移動版 HTML。因此移動版缺了内容、缺了内鏈,就等于主版本缺了内容。這一点在栏目頁和文章頁上体現得最明顯。

三種常见形態的抓取差异

  • 响應式(同一套 URL):最省事。同一份 HTML 经由 CSS 适配,两端下發的内容基本一致,很少出現抓取分歧。
  • 獨立移動域名或 m 路径:m.example.com 與 www 各自有 HTML。两邊模板如果不一起改,很容易出現移動版少模块、少連結的情况。
  • 動態下發(服務端判断 UA):按 UA 返回不同 HTML。這種做法本身可行,但两端差异過大,風險就接近隐藏内容。

移動版“少東西”會带来什么

最常见的是三類:正文被折叠或需要点击才加载、内鏈條目在移動端被砍掉、分頁和列表頁只保留前几條。蜘蛛拿到的移動版里没有這些内容,等于頁面變薄,連結發現也随之變少,深层頁面的抓取机會跟着下降。

判断标准不需要太复杂:把移動版 HTML 拿到手,看關键正文、主要内鏈、分頁入口是否都在,缺谁补谁。

自查时看哪几處

  1. 用移動端 User-Agent 請求頁面,對比返回的 HTML 與桌面版是否有關键差异。
  2. 確認移動版没有在 robots.txt 或頁面 meta 里被誤屏蔽。
  3. 確認同一 URL 不會因為 UA 不同而返回不同狀態碼或跳轉。
  4. 確認移動版與桌面版的 canonical 指向同一個規范地址。
  5. 確認内鏈在移動版里没有被脚本延後加载,導致蜘蛛跟不到。

几處容易踩的坑

  • 移動版用 302 跳到首頁,蜘蛛跟到的是一串跳轉,最终落点並不是目标頁。
  • 移動版模板精简過头,把分頁、面包屑、相關推荐都删了,抓取路径立刻變浅。
  • CDN 或前端框架只對移動 UA 返回精简内容,且差异很大,容易被视為两套内容。
  • 移動子域單獨放了一份 robots.txt,屏蔽規則和主站不一致,蜘蛛在那邊被拦住。
  • 只在桌面版维護 Sitemap,移動版的 URL 清單長期不更新,新頁面發現變慢。

运营上的取舍

能合並成响應式就合並,维護成本最低;必须保留两套时,把正文、内鏈、分頁這三件事在两邊對齐,並纳入每次改版的上线检查項。抓取策略本身不复杂,难的是長期一致。移動版和桌面版持續同步,蜘蛛看到的站点才和你以為的一样。