很多站点的收錄問题並不是從被抓取那一刻才開始的,而是在頁面设計阶段就已经埋下。同一個站点里,有的頁面天生该進索引,有的頁面進去只是占位置。與其等到索引膨胀了再回头收拾,不如在上线前就按頁面類型定好收錄策略。
先分清三種收錄档位
把站内每一類頁面往三個档位里放,判断會清晰很多。
- 必须被收錄:有獨立搜尋需求、内容自成一体、用戶會直接搜到它的頁面。
- 可收可不收:有一定聚合價值,但和別的頁面高度相似,收不收取决于站内是否缺這一類入口。
- 不该進索引:只服務于站内流程、内容重复,或者由參數组合爆炸产生的頁面。
關键在于:這個判断要按模板来做,而不是按單條 URL。模板决定了成百上千個頁面的命运。
常见頁面類型的归属
内容頁
文章、商品、問答這類主体内容頁,通常属于必须收錄的一档。前提是内容确實獨立——同一篇内容出現在多個 URL 上时,要先收敛再谈收錄。
栏目頁與分類頁
處在可收可不收與必须收錄之間。如果分類頁只有一列标题,價值接近導航;如果它带有篩選後的獨立信息,比如價格区間、地区、規格,則值得收錄。判断标准是:用戶會不會為了這一類内容专门去搜。
标簽頁與作者頁
标簽數量少、每個标簽下有足够内容时,可以留少量進索引;一旦标簽由系統自動生成、動辄上千個且每個只挂着两三篇,通常更接近不该進索引那一档。
篩選、排序與追踪參數
這些 URL 本身不承载新内容,只是同一批内容的排列组合。預設不進索引,靠 canonical 标簽或 robots meta 表達。
站内搜尋结果頁
属于典型的不该收錄。它随查询词無限生成内容,既不稳定也没有獨立價值。
附件與打印頁
PDF、图片、打印版本本身不是問题,問题是有没有一個 HTML 頁面承担了同样的信息。如果已经有,附件通常不需要單獨去争索引位置。
判断一個頁面该不该收,先問四個問题
- 有没有人會把它当作搜尋的终点?
- 它有没有本站其他頁面無法替代的内容?
- 它會不會長期稳定存在,還是随參數、库存、會话變化?
- 如果把它從索引里拿掉,用戶的搜尋结果會不會變差?
前两個問题答否,基本就可以放進不收錄那一档。
决定之後,要在几個地方同时表達
收錄策略不是寫在文档里就算數的,它需要在多個信号上保持一致:
- 内鏈:不该被收錄的頁面,不必從導航和正文里反复给出入口。
- sitemap:只提交你希望進索引的地址,不要把站内所有 URL 一股脑塞進去。
- 頁面标记:用 canonical 标明首選版本,用 robots meta 的 noindex 明确排除。
- robots.txt:它管的是抓取,不是收錄,不要拿它当排索引的工具。
一個常见誤区是:既寫了 noindex,又在 sitemap 里提交同一個地址,還在内鏈里大量指向它。信号互相打架,最终只能靠搜尋引擎自己猜。
上线之後怎么回头看
策略定完不代表一劳永逸。上线一段時間後,可以按模板抽查:被索引的 URL 數量是否和预期量級接近;有没有本该 noindex 的頁面出現在索引里;反過来,该收錄的頁面是否長期停在已發現、未编入索引的狀態。發現問题先检查信号是否一致,再考虑内容本身。
需要說明的是,這些動作的作用是让希望被收錄的頁面更清楚地表達自己,减少無谓消耗,並不等于提交了就一定被收錄。索引的最终取舍權在搜尋引擎手里,我們能做的只是把判断依據给足。