新頁面發布後迟迟不收錄,很多人的第一反應是“内容不够好”,于是改标题、加字數、补外鏈。但“不收錄”是個笼统的说法,它至少包含三個环节:URL 有没有被發現、發現了有没有被抓取、抓取之後有没有進入索引。這三步的判断方式和處理動作完全不同,混在一起猜,很容易在错誤的环节上花力气。
三個环节分別指什么
未發現:搜尋引擎還不知道這個 URL 存在
新頁面如果没有任何入口指向它,搜尋引擎就没有理由知道它。所谓入口,包括站内連結、站点地图、外鏈,以及頁面本身可被抓取的静態連結。未發現的典型表現是:站点地图提交了但没動静,站内找不到通往该頁面的連結,頁面只能靠直接輸入地址訪問。
已發現未抓取:URL 進了队列,但還没轮到
搜尋引擎知道了地址,不代表马上来取。抓取需要排队,站点整体抓取能力有限,優先級低的 URL 可能等很久。常见原因包括頁面层級太深、站点响應慢、同類頁面太多導致队列拥挤,以及頁面本身没有明顯的更新信号。
已抓取未索引:頁面被取回,但没被采用
這一步才是内容层面的問题居多。頁面被抓取了,但搜尋引擎判断它不值得單獨放進索引,可能因為内容過薄、與站内其他頁面高度重复、主体内容需要交互才出現,或者被 robots、canonical、noindex 等指令拦下。
怎么判断卡在哪一步
顺序上建议從後往前確認,因為指令類問题最好先排除。
- 先看頁面有没有被 robots.txt、noindex 或 canonical 指向別處拦住。
- 用收錄狀態查询確認 URL 是否已在索引中;如果已收錄,問题就不在這三個环节里,而在排序或展示层面。
- 如果没收錄,看是否有“已發現但未抓取”的记錄,用来区分未發現和未抓取。
- 對照服務器日誌,看搜尋引擎是否来過、来的是哪個 URL、返回什么狀態碼。
索引狀態查询工具给出的分類,本身就對應這几個环节,比只看“有没有收錄”更有信息量。
對應环节的處理顺序
如果是未發現
- 先补内鏈。從相關頁面自然鏈過去,比任何提交都直接。
- 確認站点地图包含该 URL,且没有被規則誤排除。
- 检查連結是否為可抓取的 a 标簽,而不是需要点击才触發的脚本行為。
如果是已發現未抓取
- 先看服務器响應時間和错誤率,慢站点會拖累整体抓取。
- 检查是否有大量低價值 URL 占用抓取,比如參數组合、篩選结果、重复列表。
- 再考虑站点地图和内部連結,把重要頁面往上提。
- 耐心等待。抓取排队本身需要時間,频繁改動反而會让信号不稳定。
如果是已抓取未索引
- 看内容是否完整:正文是否在初始 HTML 中,還是完全依赖脚本渲染。
- 检查是否與站内其他頁面重复,尤其是同一内容的不同 URL 寫法。
- 確認頁面有明确主题,不是素材堆叠或自動生成的拼接内容。
- 检查是否有過多的關鍵詞堆砌或明顯的模板痕迹。
几個容易誤判的情况
- 頁面已经收錄,只是查询方式没查到,誤以為没收錄。
- 抓取正常但索引被合並到另一個 URL,看起来像“没收錄”。
- 頁面内容更新了,索引仍是舊版本,這属于重新抓取問题,不是首次收錄問题。
- 站点地图提交成功不等于被抓取,提交只是提供了地址。
把“不收錄”拆成發現、抓取、索引三段,每一步都有自己的判断依據。先定位,再動手,比一上来就改内容省力得多。
實际排查时,尽量不要同时改内容、改連結、改指令。一次只動一個變量,隔一段時間再看狀態變化,才能知道是哪一步起了作用。