很多站点的内頁連結在分享、投放或站内推荐时,會带上 utm、ref、session、from 等參數。用戶点開後地址變了,内容還是同一篇。搜尋蜘蛛沿着這些連結抓取,就可能把同一個頁面抓成多個地址。時間一長,索引里出現若干版本,主地址反而被稀释。核對收錄时,先別急着改标题和正文,先把參數 URL 這件事理清。
先分清:是抓取多了,還是索引多了
參數 URL 被抓取,不一定進索引;但索引里出現多個參數版本,通常需要處理。核對时把两件事分開看:
- 抓取层:服務器日誌里參數 URL 的請求量是否明顯偏高,是否挤占了主地址的抓取频次。
- 索引层:用 site 查询或搜尋控制台的覆盖率报告,看參數版本是否被收錄、以哪個地址為主。
如果只在日誌里看到抓取,索引里没有,可以先观察;如果索引里已经出現多個版本,就要進入下一步。
一套可执行的核對顺序
- 抽样導出參數 URL:從站内連結、广告連結、分享按钮、跳轉服務里各取一批,记錄參數名和出現位置。先区分必要參數和跟踪參數。
- 查索引狀態:搜尋控制台或第三方工具,看每個參數版本是否被索引、标题和摘要是否正常。不要只看一個工具,口径不同结论會偏。
- 看日誌與响應:參數 URL 返回什么狀態碼、响應時間多少、抓取频次是否压過主地址。若大量參數地址返回 200,索引膨胀風險更高。
- 定規范地址:每個内容确定唯一主 URL。canonical 指向主地址,内鏈和分享連結尽量直接使用主地址,不再自動拼接跟踪參數。
- 處理無功能參數:對纯跟踪參數,優先清理連結来源;需要屏蔽时,先確認不會挡住主地址的發現和 canonical 传递。robots.txt 不是萬能開關,用错反而让蜘蛛看不到主地址。
- 观察與迭代:改完後看索引和日誌變化,按周或按月核對,不要期待立刻合並。
哪些參數该留,哪些该忽略
不是所有參數都要一刀切。分頁、排序、篩選、語言切換等參數,有时承载了不同内容或不同入口,需要單獨判断。跟踪參數、會话 ID、来源标记、随机值,通常只服務于統計或临时狀態,應该忽略。判断标准可以简單問一句:去掉這個參數後,頁面内容是否還一样?如果一样,它大概率不该成為獨立地址。
- 保留:分頁、必要的篩選组合、多語言或多地区入口,前提是它們有獨立價值和可索引内容。
- 忽略:utm、ref、from、session、随机數、点击 ID,以及只用于跳轉的中間參數。
- 慎用:排序和视图切換,可能生成大量组合,建议用 canonical 指向預設视图,或限制可抓取范围。
常见誤区
加了 canonical 不等于問题立刻消失。搜尋引擎需要重新抓取、重新判断,索引合並需要時間。參數 URL 没有自然流量也不代表可以放着不管,它可能持續消耗抓取资源,让重要頁面更新變慢。
另一個誤区是直接用 robots.txt 屏蔽全部參數。屏蔽抓取後,蜘蛛可能無法讀取參數頁上的 canonical,主地址的發現也可能受影响。更稳妥的做法是先清理内鏈和站内跳轉,再對真正無價值的參數做規范處理。
小范围驗證,再定規則
站点大、模板多时,不要一次性全站改。先選一個栏目或一组模板,抽样 20 到 50 個參數 URL,按上面的顺序走一遍,看索引和日誌有没有變化。確認有效後再扩展到其他模板。收錄核對本来就是细活,先把參數 URL 這條线理清,再去看内容质量、内鏈和頁面更新,判断會更准。