做站点运营的人常會盯着两個數字:站内實际能打開的頁面數,和搜尋结果里顯示的索引量。這两個數字几乎從来不會相等,差出几倍甚至几十倍都不奇怪。問题不在于數字本身,而在于你無法判断這個差距是正常的,還是有一批頁面本该被收錄却没有,又或者有一批不该存在的地址正在占用索引位置。要回答這個問题,先把“應收錄基线”建出来。
為什么两個數字天生對不上
索引量是搜尋引擎侧的估算值,更新有延迟,統計口径也不完全對等;站内頁面數則取决于你怎么數——資料库里有多少條记錄、後台有多少篇已發布内容、還是爬虫實际能訪問到多少個返回正常狀態的地址。三種數法能差出好几倍。所以第一步不是去解释差距,而是先确定拿什么去比。
第一步:定义應收錄基线
基线指的是:你希望被搜尋引擎發現並纳入索引的那部分 URL。它不是全站所有 URL,而是筛掉噪声之後的结果。常见判断可以按下面三條来梳理:
- 應当纳入:獨立的内容詳情頁、有獨立检索價值的栏目頁、承载唯一内容的分頁或聚合頁。
- 不應纳入:站内搜尋结果頁、带排序或篩選參數的地址、測試與预览地址、重复的 URL 變体(大小寫、尾斜杠、跟踪參數)。
- 需要單獨决策:分頁、标簽頁、作者頁、归档頁。它們不是天然该收或不该收,取决于是否有獨立内容與内鏈價值。
把這三類分開记錄,基线才有意义。否則“少了三百個頁面”這種结论,很可能只是把參數頁算進去了。
第二步:把基线變成可核對的清單
口径确定之後,尽量让它可复現,而不是每次凭印象重来。一個可用的流程是:
- 從站点地图、資料库或後台導出全部 URL,形成主清單。
- 按上面的三類規則打标簽,剔除明确不该收錄的地址。
- 對保留的 URL 做一次可訪問性抽检,確認返回狀態正常、内容不是空壳。
- 记錄清單生成時間。後續比對必须使用同一口径的清單,否則差异無法解释。
清單不必做到百分之百全量,但抽样規則要固定,比如按栏目分层各抽一部分,這样每次结果才具备可比性。
第三步:分類比對差异
拿到基线和索引資料之後,差异通常落在两個方向,處理方式完全不同。
索引量多于基线
說明有一批你没打算让它進索引的地址被收錄了。常见来源是參數组合、站内搜尋、多域名或多协议入口、歷史遗留的舊地址。這时要做的不是逐個删頁面,而是回到 URL 生成源头收敛,再對已经存在的那部分用規范标簽或狀態碼處理。
索引量少于基线
說明有一批本该被收錄的頁面没有進入索引。這时要把“没收錄”再拆開看:是没被發現、被發現但没抓取、抓取了但没编入索引,還是编入過又被移出。這几類的排查方向差异很大——發現环节看内鏈和站点地图,抓取环节看服務器日誌與响應速度,编入环节則要看頁面质量與重复程度。
第四步:按類型决定動作
- 多余的參數地址:從連結生成處收敛,配合規范标簽或抓取規則。
- 重复的内容頁:确定主版本,其余做規范指向或合並。
- 長期不收錄的弱内容頁:先判断是否值得保留,不值得就合並或下线。
- 有獨立價值但收錄慢的頁面:優先补内鏈入口,而不是反复提交。
把“索引量對不上”拆成“哪些该收没收、哪些不该收却收了”两個問题,比反复提交地址或猜测算法更有效。數字本身不解决問题,口径才解决。
最後提醒一点:索引資料更新有延迟,刚上线或刚改版的站点在几周内數字波動都属于正常范围。核對周期建议拉到两周以上,避免把延迟当成問题去處理。