一個頁面從發布到出現在搜尋索引里,通常要经過發現、抓取、解析、索引四個环节。很多“收錄慢”或“不收錄”的問题,其實只卡在鏈條中間某一步,而不是整站出了毛病。與其反复提交 URL、反复改标题,不如按顺序確認每一步的狀態,把精力放在真正堵住的地方。
一、發現:蜘蛛得先知道這個 URL 存在
發現是整條鏈路的起点。如果你的頁面没有任何入口指向它,蜘蛛连“有個新地址”都不知道,後面的环节就無從谈起。
- 站内連結:頁面是否從首頁或栏目頁通過可点击的 a 标簽連結到?只在 JS 里跳轉、只在表單提交後到達的地址,發現概率會低很多。
- Sitemap:新頁面有没有及时進入 sitemap?進了但地址寫错、被規則屏蔽,也等于没提交。
- 外部引用:其他站点是否有連結指向它。外部連結不是必需的,但能加快發現速度。
- 日誌核對:在服務器日誌里搜一下這個 URL,看蜘蛛有没有来過。如果一次都没出現,問题就在發現环节。
二、抓取:知道地址,不代表马上會来
日誌里能看到蜘蛛訪問记錄,說明發現已经完成。這时要看的就不是“有没有来”,而是“来了之後發生了什么”。
- 响應狀態:返回的是 200,還是 301、302、403、5xx?非 200 的响應會直接影响後續處理。
- 抓取频次:小站抓取額度有限,頁面又多,蜘蛛可能排在很後面。這时要優先保證重要頁面在合理的内鏈深度内。
- 服務器表現:如果日誌里出現大量超时或 5xx,先把服務器問题解决,再谈抓取节奏。
- robots.txt:確認没有被規則誤屏蔽,包括路径寫错導致的整段屏蔽。
三、解析:抓到了,也要能讀懂
頁面被抓取,不代表内容被正确理解。特別是依赖前端渲染的站点,這一环节最容易出問题。
- 渲染依赖:正文是否只有在执行 JS 後才出現。如果服務端返回的是空壳,蜘蛛看到的可能就是一片空白。
- canonical 與 noindex:頁面上是否誤寫了指向別處的 canonical,或残留了 noindex 标簽。這两類寫法會直接改變頁面的處理结果。
- 返回内容一致性:给蜘蛛返回的内容和给用戶的是否一致。差异過大时,頁面可能被判定為不可信。
四、索引:讀懂了,還要判断值不值得留
前面三步都正常,頁面仍可能停在索引之外。這时要考虑的是頁面本身的價值判断,而不是技術故障。
- 内容單薄或重复:與站内其他頁面高度相似,或信息量太少,容易只被当作备選。
- 頁面類型:标簽頁、篩選頁、分頁、搜尋结果頁,本身就不适合大量進入索引,需要有取舍。
- 时效與更新:長期没有更新、也没有外部關注的頁面,處理優先級自然靠後。
五、按环节定位,而不是一次性全改
排查时建议按下面的顺序走,每確認一步再往下,避免同时改十几個地方反而看不清原因。
- 日誌里搜 URL,確認蜘蛛是否訪問過;没有訪問,先修發現路径。
- 有訪問记錄时,看返回狀態和响應時間;異常先修服務器和規則。
- 狀態正常时,检查頁面渲染结果與 meta 指令;有問题先修輸出。
- 以上都正常,再回到内容层面,判断這個頁面是否真的值得被收錄。
提交 URL、更新 sitemap 只是辅助手段,不能替代可用入口、正常响應和合格内容。把鏈條查清楚,再决定動哪一环,通常比反复提交更有效。