蜘蛛来過,不等于頁面會被收錄。抓取、索引、收錄其實是三個不同阶段,中間任何一层出問题,頁面都可能停在队列里。把排查過程想成一個漏斗:先能抓,再能索引,最後才谈是否值得放進索引。
第一层:可抓取
如果蜘蛛连頁面都拿不到,後面的事都不用谈。常见卡点集中在服務器與 URL 本身:
- 狀態碼不稳定:間歇性 502、504 或大量 403,會让蜘蛛降低抓取频次,甚至暂时放弃這個目錄。
- robots.txt 誤伤:整站屏蔽、誤屏蔽 CSS/JS,或寫错路径,都會让頁面無法進入正常抓取流程。
- URL 規范混乱:同一内容有带參數、大小寫、尾斜杠多個版本,蜘蛛可能在變体之間来回抓,真正的主版本反而没被稳定發現。
- 入口太少:没有内鏈、站点地图又没列出的 URL,蜘蛛發現得慢,甚至長期發現不了。
這一层可以用服務器日誌、站点地图和 URL 检查工具對照:看蜘蛛是否真的請求了目标 URL,返回碼是什么,抓的是哪個版本。
第二层:可索引
頁面能被抓取,也可能被明确或隐含地排除在索引之外。重点看响應头和頁面里的指令:
- noindex:meta robots 或 X-Robots-Tag 寫了 noindex,頁面抓取正常,但不會進索引。
- canonical 指向別處:頁面自己声明主版本是另一個 URL,搜尋引擎通常會按 canonical 收口。
- 重复内容:站内多個 URL 内容高度相似,系統會選一個主版本,其余可能只抓不收。
- 渲染後才有内容:首屏依赖 JS 渲染时,要確認渲染後的 HTML 里确實有正文、連結和必要的元信息。
抓取工具看到的是原始 HTML 還是渲染结果,會直接影响判断。對 JS 站点,最好用抓取測試或渲染後的 HTML 對照一次。
第三层:值得索引
能抓、也能索引,不代表頁面會被放進索引。搜尋引擎還要判断這個頁面是否值得占一個位置。常见的“抓了不收”包括:
- 内容太薄,只有几句话或纯參數篩選结果。
- 與站内其他頁面高度同质,僅換了排序或篩選條件。
- 頁面主题不明确,标题、正文和用戶可能搜尋的词對不上。
- 聚合頁、标簽頁大量生成,但每個頁面没有獨立價值。
這一层没有開關可以打開,能做的是提高頁面的獨立價值:补足正文、明确主题、收敛重复入口,把不值得收錄的頁面用 noindex 或 robots 挡在索引之外,而不是让它們消耗抓取。
怎么判断卡在哪一层
- 先用站点地图或内鏈找到目标 URL,確認蜘蛛最近是否抓過。
- 看日誌里的返回碼和抓取版本,判断可抓取层是否正常。
- 用 URL 检查工具看抓取时的 HTML、noindex、canonical 和渲染结果。
- 如果前三步都正常,再去對比同模板頁面:是單個頁面不收,還是一批都不收。
- 最後看頁面质量與站内重复情况,判断是否属于“可抓但不值得收”。
三层漏斗不是一次性检查,而是一個排查顺序。先排除硬性阻断,再處理收口問题,最後才去優化内容质量。這样定位起来會比反复提交 URL 更有方向。需要說明的是,排查能减少阻碍,但没人能承诺某個頁面一定被收錄,最终仍由搜尋引擎决定。