做站点运营时,很容易把“收錄”当成一個越多越好的指标。實际上,索引容量和抓取资源都有限,把不该收錄的頁面大量送進索引,反而會稀释真正重要頁面的信号。更實际的做法是:先给頁面分角色,再决定去留。抓取與收錄是两件事,蜘蛛来過、URL 被發現,都不等于會進入索引;而進入索引之後,頁面是否该留下,需要單獨判断。
一、先按頁面角色分层
同一個站点里,頁面承担的任務不同,收錄策略也不该一样。可以用下面几類先做粗分:
- 核心内容頁:产品、服務、主要栏目、支柱文章。目标是稳定留在索引里,並參與排名。
- 長尾内容頁:文章、問答、案例、地区頁。只要内容獨立、有搜尋需求,就值得收錄,不要因為流量低就急着 noindex。
- 功能頁:登入、註冊、购物车、個人中心、站内搜尋结果。通常没有獨立搜尋價值,不该占用索引名額。
- 過滤與排序頁:颜色、價格、排序、分頁參數组合。容易产生大量近似重复,需要控制。
- 歷史與归档頁:過期活動、舊版本、測試頁。按是否仍有訪問價值决定保留、合並還是清理。
二、核心頁和長尾頁:尽量保證 URL 唯一
這些頁面要進索引,前提是地址規范。同一篇内容只保留一個主 URL,其余寫法用 301 指向主版本。常见的不規范包括大小寫混用、带與不带尾斜杠、參數顺序不一致、http 與 https 並存。canonical 可以辅助表達主版本,但它不是萬能的,能通過服務器和連結直接统一时,優先做直接统一。
同时检查内鏈。一個頁面如果只能從站点地图里找到,蜘蛛可能很久才来一次。把重要頁面放進導航、栏目頁或相關推荐,比反复提交更實际。
三、功能頁與過滤頁:多數情况下不该進索引
站内搜尋结果頁、排序參數頁、會话 ID 頁面,通常不建议收錄。處理方法要分情况:
- 如果頁面完全不需要被抓取,可以在 robots.txt 中屏蔽,减少抓取浪費。
- 如果希望蜘蛛看到頁面但不索引,可以使用 noindex,但注意不要和 robots.txt 屏蔽同时用,否則 noindex 可能永遠讀不到。
- 過滤參數如果對用戶有價值,可以保留一個主篩選路径,其余參數規范到主路径,而不是全部 noindex。
四、重复内容先合並,再谈收錄取舍
重复内容大致分三层:完全重复、近似重复、模板重复。完全重复的頁面應合並並 301;近似重复可以用 canonical 指向主版本,同时逐步收敛内鏈;模板重复往往来自分類頁、标簽頁和分頁,需要改模板或只保留有獨立價值的入口。没有處理重复之前,單獨讨论某個 URL 该不该收錄,往往會出現反复:今天被收錄,明天又被替換。
五、判断一個 URL 去留的检查顺序
- 它是否有獨立的搜尋價值?没有的话,優先考虑功能頁或過滤頁的處理方式。
- 它是否有唯一的規范 URL?没有就先统一地址,而不是急着提交收錄。
- 它是否可被抓取?robots、登入墙、大量 JS 都可能让頁面無法被正常讀取。
- 它是否與已有頁面高度重复?重复的先合並或 canonical,再决定是否保留。
- 進入索引後是否有人维護?長期無人更新、内容過期的頁面,要有登出机制。
- 最後才是决定:保留在索引、合並、301、noindex,還是刪除。
六、抓取與收錄的区別,决定了你该做什么
蜘蛛池、外鏈、站点地图能帮助 URL 被發現和抓取,但索引是否接纳,取决于頁面质量、重复程度和站点整体结构。被大量抓取却没有收錄的頁面,通常不是蜘蛛没来,而是頁面本身不具备獨立索引價值。把抓取资源留给核心頁和長尾頁,把功能頁、過滤頁和重复頁挡在索引之外,索引结构會更干净,後續排查收錄問题也更容易定位。
收錄不是把所有 URL 都塞進索引,而是让该出現的頁面稳定出現,不该出現的頁面不占位置。