常见問题

搜尋蜘蛛已经抓取了目标 URL,為什么還是不進索引?

日誌里明明看到搜尋蜘蛛来過、目标頁也返回 200,搜尋结果里却始终找不到它,這種落差很常见。本文把抓取與收錄拆成两個环节来看,列举入口頁层面、目标頁内容层面和站内技術层面的常见原因,並给出一套可以照着做的排查顺序,帮助判断問题到底出在哪一步。

常见問题

搜尋蜘蛛已经抓取了目标 URL,為什么還是不進索引?

很多人用蜘蛛池推目标 URL 时,會在服務器日誌里看到搜尋蜘蛛确實来過、目标頁也返回了 200,于是開始等收錄。结果一周、两周過去,搜尋结果里還是没有它。這时候容易得出一個结论:蜘蛛池没用。實际上,抓取和收錄是搜尋系統里两個獨立的环节,入口頁负责的是把蜘蛛引過来,剩下的判断在搜尋引擎那邊完成。

抓取和收錄是两件事

抓取只說明爬虫程序請求了這個 URL,並且成功拿到了内容。收錄意味着這份内容進入了索引库,可以被搜尋结果調用。中間還隔着内容质量判断、重复内容比對、站点整体评價、頁面價值計算等步骤。日誌里有蜘蛛,只證明了第一步成立,後面的步骤和入口頁的關系並不大。

目标頁抓了却不收錄,常见原因有哪些

内容本身的問题

  • 内容與其他頁面高度重复,包括同站多個 URL 輸出同一套内容、拼接采集的内容;
  • 正文太短或几乎只有導航、广告、联系方式,被判為没有可索引的主体内容;
  • 頁面是列表頁、搜尋结果頁、标簽頁這類聚合型頁面,且没有獨特信息;
  • 頁面主体信息過时,或者長期停留在“建设中”的狀態。

技術层面的問题

  • 頁面返回 200,但 body 里其實是错誤提示或空白,蜘蛛拿到的是無效内容;
  • robots meta 寫了 noindex,或者被响應头里的 X-Robots-Tag 挡住;
  • canonical 指向了別的 URL,等于主動把這一頁的内容归给另一個地址;
  • 整站被算法或人工處理,單頁再努力也不會立刻见效。

入口頁层面的問题

入口頁不直接决定目标頁收不收,但它會影响搜尋引擎怎么理解這批連結。如果入口頁本身是薄弱域名、頁面除了連結几乎没有内容、锚文本批量堆同一批關鍵詞,搜尋引擎很可能把這些連結整体降權,蜘蛛来過一次之後就不再重视。

蜘蛛池能解决的是“發現”和“来過”,解决不了“這頁值不值得收錄”。把入口頁当成收錄開關,期望值一開始就设错了。

可以動手排查的几步

  1. 在日誌里確認請求目标 URL 的 UA、時間和返回碼,区分真實搜尋蜘蛛與其他爬虫;
  2. 用搜尋引擎自带的 URL 检查工具看抓取詳情,能看到抓取時間、渲染结果以及是否被 noindex;
  3. 检查 canonical 和 hreflang,確認没有把權重指向別處;
  4. 對比同站已经收錄的頁面,看内容结构、篇幅、更新频率差在哪里;
  5. 用 site: 查询看整站收錄量是停滞還是整体下滑,区分單頁問题和全站問题。

多久没收錄需要重新判断

没有统一的时限。抓取後几天收錄、几周後收錄、一直不收錄的情况都出現過。比較稳妥的做法是给自己定一個观察窗口,比如两到四周,期間记錄抓取次數和目标頁的改動,窗口結束後再决定是繼續观察,還是回头改内容。反复提交同一個没有變化的 URL,通常不會改變结果。

入口頁该承担什么角色

務實的做法是:把入口頁当作一條稳定的發現通路,保證它能被爬、連結清晰、指向的目标 URL 狀態正常,然後接受“收錄由目标頁自己决定”這個前提。目标 URL 本身内容薄弱、结构混乱,入口頁再多也只是让蜘蛛多跑几趟空路。

真想让目标 URL 更容易被收錄,顺序應该是先修内容和技術問题,再考虑用入口頁扩大發現面。反過来做,通常只是把日誌里的抓取次數刷得好看一点,搜尋结果不會有變化。