很多人在判断“收錄好不好”时,习惯打開搜尋框輸入 site 指令,看一眼數字,然後對比一下心里估的頁面數。這個做法本身没問题,問题出在两邊都不可靠:搜尋给出的數字是一個大致范围,而心里估的那個頁面數,通常既没有覆盖全部 URL,也混進了一堆本来就不该被收錄的地址。
為什么“收錄少”這個结论经常站不住
收錄比例是一個除法。分子是搜尋引擎實际建立索引的 URL 數量,分母是站点認為自己有的 URL 數量。分子不好精确获取,分母又常常是拍脑袋想出来的,两個不准确的數字相除,得出的结论自然只能当參考,不能当依據。更麻烦的是,分母里如果混着一批本来就應该被排除的 URL,比例會被永久压低,你會一直以為有問题,其實只是口径算错了。
第一步:把分母确定下来
分母的目标不是“網站一共有多少條資料”,而是“網站對外暴露了多少個可訪問的 URL”。這两者经常不一致,可以從三個来源交叉比對。
sitemap
這是最直接的来源,尤其适合内容型站点。注意 sitemap 里應该只放你希望被收錄的規范 URL,如果里面本来就有重复和參數變体,那它就不能直接当分母用。
内容後台或資料库
文章、商品、分類各有各的表。把每類内容的主键數量加起来,再乘以每類對應的 URL 形態數量(比如一篇内容同时有詳情頁和打印頁,就是两種形態),能拿到一個接近真實的分母。
服務器日誌與站内連結抓取
日誌能告诉你搜尋引擎實际請求過哪些路径,往往比你登记的還多,多出来的那部分通常就是參數、大小寫或歷史遗留地址。用一個简單的站内爬取工具從首頁出發也能得到一份 URL 清單,和上面两份對一下,差集往往就是問题所在。
第二步:把不该進分母的 URL 剔掉
這一步决定了比例是否可信。以下几類通常不该計入:
- 已经被 robots.txt 屏蔽或設定了 noindex 的頁面,這些本来就不會進索引。
- 篩選、排序、分頁參數产生的组合地址,大部分属于同一内容的不同视图。
- 站内搜尋结果頁、内部跳轉頁、測試和预览地址。
- 返回 404、410、5xx 的歷史 URL。
- 带跟踪參數的推廣連結。
- 與規范頁内容高度重复的镜像版本(www 與非 www、http 與 https 混用的残留)。
剔完之後剩下的,才是“值得被收錄”的候選集合,這才是合理的分母。
第三步:按類型看,而不是看總數
一個笼统的百分比說明不了什么。更實用的做法是按頁面類型分组:文章詳情頁、分類頁、标簽頁、商品頁、帮助文档頁,各自算一遍。常见的情况是詳情頁收錄正常,而分類和标簽頁大面积没進索引——這时候要讨论的是聚合頁该不该放開收錄,而不是笼统地说“網站收錄差”。
如果某個類型長期接近零收錄,先怀疑這個類型的设計是否有意避開了索引,而不是立刻归因于抓取不足。
几個容易踩的坑
- 把 site 指令的數字当精确值。它只反映一個大致的量級,不同時間查询也會波動。
- 把“被抓取”当成“被收錄”。日誌里有請求记錄,只能說明蜘蛛来過。
- 忽略新建頁面需要時間。刚發布的 URL 出現在索引里本来就有延迟。
- 分母里塞進大量低價值 URL,然後長期為這個比例焦虑。
一份可执行的检查顺序
- 導出 sitemap 里的全部 URL,作為基础清單。
- 用日誌补充清單,标出 sitemap 里没有但被請求過的地址。
- 按上述規則逐條剔除不该計入的 URL。
- 把剩下的 URL 按頁面類型打标簽分组。
- 對每個類型抽样查看索引狀態,而不是只看一個總數。
- 對長期未收錄的组,單獨排查是抓取、索引還是頁面本身的問题。
把分母算清之後,你會發現很多“收錄問题”其實是統計口径問题。真正的排查工作,應该從一份干净、分類明确的 URL 清單開始。