同一套模板生成的頁面,一部分進了索引,另一部分迟迟不见踪影,這是很常见的情况。這时最没效率的做法,是打開搜尋资源平台一個個提交 URL,或者對着未收錄的頁面反复检查。更快的路径是先算出這一類頁面的收錄比例,再按模板分组做差异比對,找出“收錄组”和“未收錄组”之間稳定的区別。
先確認口径:整体偏低,還是某一類偏低
統計之前要先统一口径。可被抓取的 URL 有哪些、其中多少已经出現在索引里,這两個數字决定了問题的范围。如果全站收錄比例尚可,只是商品詳情頁偏低,那排查重点就應该放在這一類模板上,而不是全站重构。
- 把頁面按模板或内容類型归堆,分別統計比例,而不是只看總數。
- 区分“已被抓取”和“已進索引”,两者不要混在一起算。
- 把带參數的地址、站内搜尋结果頁等非正式頁面排除在分母之外。
按能解释差异的维度分组
分组要選那些可能影响索引决策的维度,随手按 ID 分段没有意义。
- 内容類型:文章、商品、問答、标簽頁的索引表現往往差別很大。
- URL 形態:目錄层級、是否带參數、是否带排序或追踪字段。
- 發布時間段:新老頁面混在一起統計,會掩盖真實問题。
- 發現路径:是否出現在列表頁前几屏、是否有内鏈指向、是否在 sitemap 中。
- 正文特征:字數、模板文字占比、是否有可索引的标题與描述性内容。
逐组比對,重点看四個差异点
抓取與收錄要分開看
抓取记錄只說明蜘蛛来過。抓取過不等于被收錄,而“没被抓取”和“抓取後未收錄”處理方向完全不同。先看服務器日誌或索引狀態,把两组頁面各自归類,再往下查。
内容量與唯一性
同一模板下,正文很短的頁面被留下的概率通常更低。比如商品頁只有參數表、没有描述,文章頁只有标题和两三行摘要。可以對比收錄组與未收錄组的平均正文長度,不必追求某個固定數字,只看组間差异是否明顯。
内鏈與發現路径
如果未收錄的頁面大多没有站内連結指向,只能靠 sitemap 被發現,問题可能出在連結结构而不是内容质量。挑几個样本,检查它們距离首頁的点击深度、被連結的次數和来源頁面的類型,往往能让問题浮出水面。
規范信号與狀態
模板改版後遗留的 canonical、隐藏的 noindex、參數造成的重复地址,都會让同一批頁面表現不一致。核對时確認三件事:canonical 是否指向自身、返回碼是否長期稳定、同一份内容是否只有一個主要地址。
可以照着走的核對顺序
- 拉一份可被抓取的 URL 清單,算出這一類的收錄比例。
- 按模板或内容類型分组,找出比例明顯偏低的那一组。
- 在這组里分別抽样“已收錄”和“未收錄”,對比狀態碼、canonical、内鏈、正文長度。
- 確認這些頁面是否被抓取過:没抓取過,先解决發現與連結;抓取過没收錄,再谈内容與規范。
- 一次只改一處,观察一到两周再评估,不要同时動多個變量。
收錄是搜尋引擎综合判断後的结果,不是提交動作換来的開關。把精力放在缩小“未收錄组”和“已收錄组”的差异上,比逐頁催促更有效。
两個常见誤区
一是把提交收錄当成修复手段。提交只影响發現,如果頁面本身與已收錄頁面高度相似,提交多少次也很难改變结果。二是只看單頁表現、不看分组。個別頁面不收錄可能只是正常波動,一類頁面的收錄比例長期偏低,才值得動手排查。
把核對做成周期性的動作,每次只针對一個分组、一個變量,慢慢就能看出模板、内容或連結结构里真正需要調整的地方。