新域名上线、老站加新栏目,最常见的焦虑是:頁面寫得挺完整,連結也能打開,但搜尋里就是搜不到。這时候容易做的動作是反复提交、加大量外鏈、甚至怀疑域名被惩罚。實际上,從 URL 被生出来到進入索引,中間有几道獨立的關卡,先分清卡在哪一步,比盲目加動作有效得多。
一、先分清「没收錄」是哪一種狀態
很多人说“没收錄”,其實指的是三種不同情况:
- URL 從未被抓取過,站内也能看到它,但在抓取记錄里没有痕迹;
- 被抓取過,但一直停在“已發現 / 已抓取未索引”的狀態;
- 曾经進過索引,後来被移除,或替換成了別的 URL。
這三種情况的處理方向完全不同。第一種要解决的是入口和鏈路問题;第二種更多是頁面價值和站点整体信任度的問题;第三種要先查規范化、重复内容和内容變更。用同一個办法去套三種情况,通常只會浪費時間。
二、抓取入口:新 URL 是怎么被發現的
搜尋引擎發現一個新地址,主要靠這几條路径:
- 站内連結:列表頁、導航、相關推荐、翻頁。這是權重最高的發現路径,孤岛頁面(只有 sitemap 里有、站内点不到)往往長期不進队列。
- XML sitemap:它能补充發現,但更像一份“待抓清單”,不保證優先級。sitemap 里塞了几十萬條含參數、含已刪除的地址,會让真正的新頁面排在後面。
- 外部連結:来自其他站点或本站在外部渠道的内容分發,能明顯加快發現速度,但不是必要條件。
- 手動提交入口:适合少量重点頁面,用在“確認頁面已经准备好”之後,而不是每天重复提交同一批地址。
核對方式很简單:随便挑几個目标 URL,看站内是否有至少一條可点击、位置稳定的連結指向它。如果只能靠搜尋框或 sitemap 找到,那先补内鏈,別急着怪收錄。
三、被抓了却没進索引:多看看頁面本身
抓取和收錄是两件事。服務器日誌里天天出現抓取记錄,只能說明蜘蛛来過,不代表頁面會被留下。常见的“抓了不收”原因有:
- 同质化嚴重:同一批模板生成的頁面,正文只有几個字段不同,容易被判断為重复,最终只保留其中一部分。
- 有效信息太少:正文之外全是大段導航、推荐、广告、版權声明,主体内容占頁面比例過低。
- 需求本身很小:有些内容搜尋量本就有限,收錄结果和展現结果是两套資料,评估时不要混在一起看。
- 站点規模突增:新站或改版後一次放出几千個 URL,抓取队列被拉長,收錄會分批推進。
- URL 規范有問题:同一内容出現多個變体、大小寫混用、參數版本可訪問,都會分散归並信号。
四、別把“收錄慢”直接当成“被惩罚”
新域名没有歷史积累,抓取频次低是正常現象。真正需要警惕的信号是:老站原本稳定收錄的頁面大面积掉出索引,同时抓取量断崖式下降。如果只是新栏目、新目錄推進慢,更可能是發現路径和頁面價值的問题。
另外,改版、批量下线、URL 结构變更這些操作,都會让收錄資料在几周内上下波動。判断趋势时,用同一口径(比如站長後台的已编入索引資料,而不是第三方估算)看四周以上的曲线,比盯單日數字靠谱。
收錄是结果,不是可以單獨優化的指标。把入口打通、把頁面做扎實、把 URL 收干净,剩下的交给時間。
五、可按顺序执行的核對清單
- 確認目标 URL 返回 200,且正文在服務端返回的 HTML 里可讀。
- 確認頁面没有誤寫 noindex,也没有被 robots.txt 拦截。
- 確認站内至少有一條稳定、可点击的内鏈指向它。
- 检查 canonical 指向自己,且同一内容没有多余的 URL 變体可以訪問。
- 整理 sitemap:只保留有效、可索引、内容合格的地址,定期清理已刪除項。
- 新頁面按批次上线,避免一天内放出遠超日常量級的 URL。
- 观察两到四周的抓取與索引變化,再决定是否調整结构和内容。
這套顺序的價值在于:每一步都能给出“是 / 否”的判断,避免在入口没問题的时候去改内容,也避免在内容還没准备好时反复提交地址。