打開索引覆盖率报告或直接做一次 site 查询,看到一批带問号的地址:?q=、?sort=、?filter=、?page= 层层叠加。這些多數来自站内搜尋框和各種篩選控件。它們能被收錄,通常不是搜尋引擎主動造出来的,而是站点自己把可抓取的入口放了出去。
先看這些地址是怎么产生的
按生成方式拆開,處理思路會清晰很多:
- 站内搜尋结果頁:用戶站内搜尋後跳轉到的地址,只要連結被輸出到頁面上,就可能被抓取。
- 排序與篩選參數:列表頁的排序切換、多條件篩選,每變一次就生成一個新地址。
- 分頁與篩選叠加:篩選條件再加頁碼,數量按乘法增長。
- 跟踪與會话參數:来源标记、临时會话 ID 挂在地址後面。
這類頁面和尾斜杠、大小寫那種情况不一样。尾斜杠是同一個地址的不同寫法,而參數頁地址确實不同、内容也略有区別,只是主题高度近似、數量没有上限。也正因如此,它們很容易被当成獨立頁面進入索引。
判断哪些该留、哪些该收
不是所有參數頁都该清掉。判断标准其實很简單:這個组合有没有人真的會搜,有没有獨立的展示價值。
- 有明确需求的核心篩選组合,可以考虑保留,甚至做成静態化的固定入口。
- 由用戶随意輸入生成的搜尋结果頁,一般没有留的必要。
- 纯排序、纯跟踪參數,通常只影响展示顺序,不影响内容主体。
處理顺序:從生成源头到索引狀態
- 先断掉自動生成。站内搜尋结果頁預設加 noindex,不要让它成為可長期抓取的公開頁面。
- 控制内鏈和站点地图。只要頁面上的連結不指向這些组合,站点地图也不提交,抓取压力就會小很多。這一步比後面任何补救都有效。
- 再選抓取或索引手段,並注意冲突。robots.txt 屏蔽的是抓取,不能保證把已有條目移出索引;而被屏蔽之後,抓取工具看不到頁面上的 noindex,索引里的條目可能長期保留、只剩一個没有摘要的地址。要移除索引,優先用可以抓取的 noindex。
- 给确有價值的多參數頁面指定規范地址。canonical 指向對應的主列表頁,注意目标頁本身必须可抓取、可索引,否則信号會落空。
- 最後處理已经收錄的條目。多數情况等重新抓取後自然收敛,量很少时可以用移除工具,但不要靠它解决结构性問题。
抓取控制和索引控制是两回事。屏蔽抓取往往只是让問题從报告里看不见,而不是真的解决。
收敛之後怎么驗證
改動生效有滞後,观察周期按周看比較現實。可以對照三處:索引报告里相關地址的數量趋势、site 查询的结果、服務器日誌里這些地址的抓取频次。三條线索方向一致,說明收敛在起作用。
它還會再長出来
參數頁不是清一次就結束的事。新的篩選维度、新的排序方式、新的营销跟踪參數,都會重新生成一批地址。更稳的做法是在模板和連結輸出层面控制:預設不把可组合的參數連結渲染成可抓取的 a 标簽,新增參數上线前先確認它到底该不该被索引。