很多人排查收錄問题,习惯一上来就問是不是没提交 sitemap、是不是蜘蛛根本没来。其實收錄是多环节叠加的结果,任何一個环节掉鏈子,頁面都進不了索引。與其東一榔头西一棒子,不如按固定顺序過一次自查,把變量逐個排掉。
先分清三件事:抓取、收錄、索引
抓取是爬虫把頁面下载下来;收錄通常指搜尋引擎把這條 URL 纳入自己的資料库;索引則是頁面经過解析、去重、质量评估後,真正具备參與搜尋展示的资格。三者是递進關系,不是同一件事。日誌里看到 200 狀態碼,只能說明抓取成功,後面的环节還没開始。
区分這一点很重要:如果爬虫根本没来,問题在發現與抓取;如果来了却停在门外,問题多半出在頁面本身或站点信号上。
第一步:先看 URL 是否規范
- 同一頁面是否只有一種寫法,大小寫、结尾斜杠、參數顺序是否统一。
- 是否带有多余的跟踪參數、會话 ID、排序參數,導致同一内容出現多條地址。
- URL 中是否混入中文、空格或未正确编碼的特殊符号。
- 分頁、篩選、排序结果是否被大量放開抓取。
URL 不規范的直接後果,是抓取額度被大量相似地址消耗,真正需要收錄的頁面反而排不上队。
第二步:判断頁面本身值不值得收
内容是否獨一份
從別處搬运、只改标题和几段话的頁面,即使被抓到也很难進入索引。搜尋引擎需要的是能补充信息的内容,而不是同一段话的第 N 個副本。
頁面是否有實际主体
只有導航、广告和一句提示语的空壳頁,返回 200 也不會被当成有效頁面。列表頁一旦翻到很後面没有實际條目,同样属于這一類。
是否與用戶查询有關联
有些頁面内容完整,但主题過于邊缘或過于宽泛,搜尋引擎判断不出它该服務哪類需求,收錄後也很难稳定获得展示。
第三步:處理重复與近似重复
重复不一定是完全照抄,下面几種形態都會稀释頁面的獨立性:
- 同一商品挂在不同分類下,生成多條 URL,内容几乎一致。
- PC 頁與移動頁各自獨立 URL,且没有互相声明關系。
- 打印版、分享連結、带參數的版本各自成頁。
- 正文相同但评论、推荐位不同,被当成不同頁面。
處理方式通常是收敛:保留一個主版本,其余通過規范化声明或重定向指向它,並确保内鏈和 sitemap 都指向主版本。
第四步:检查站点层面的信号
- 内鏈:重要頁面是否從首頁或栏目頁有可点击入口,而不是只靠 sitemap 列出。
- robots 與 meta:是否誤屏蔽了整個目錄,或頁面上残留了 noindex。
- canonical:是否指向了自己,還是被模板批量指向了別的頁面。
- 服務器响應:是否稳定,是否有大量超时、5xx 或不必要的跳轉鏈。
第五步:用資料驗證,而不是靠感觉
- 先看服務器日誌,確認目标頁面到底有没有被訪問過,訪問频率如何。
- 再看索引狀態,区分“已發現未抓取”“已抓取未收錄”“已收錄”三種情况。
- 抽样几個頁面的實际渲染结果,確認爬虫看到的内容和用戶看到的一致。
- 對照改動時間,判断是内容問题還是某次配置調整带来的影响。
- 一次只改一個變量,改完留出观察窗口,避免多因素混在一起说不清因果。
收錄不是提交動作的终点,而是頁面质量、URL 規范與站点信号共同作用的结果。與其反复提交,不如把頁面本身的短板补上。
按這個顺序走一遍,多數“為什么没收”的問题都能定位到具体环节。剩下的,就是等爬虫重新评估——這部分急不来,也不该靠堆砌地址去催。