站点小的时候,收錄問题通常是一個個頁面的事:某個頁面没收,就去查内鏈、查 noindex、查内容寫得够不够。站点變大之後,問题會變成另一種形態——该收的迟迟不進索引,不该收的却源源不断,索引總量看着在涨,能带来搜尋流量的頁面却没几個。這时候更有效的做法不是逐個 URL 排查,而是先给站内 URL 分层,再按层的目标去定策略。
先给站内 URL 分個類
分類的标准不是頁面做得好不好看,而是它承担什么角色,以及我們希望它出現在搜尋结果里起什么作用。
- 核心内容頁:文章、产品詳情、主要的栏目入口。這類頁面是流量主力,目标是稳定被抓取、被收錄。
- 聚合與長尾頁:标簽頁、分類翻頁、多條件篩選、按地区或時間维度生成的聚合。價值參差不齐,需要逐個判断。
- 功能頁:站内搜尋结果頁、排序參數、登入、购物车、打印頁、分享頁。多數情况下不需要進索引。
- 歷史頁:已結束的活動、下架的商品、被替換的舊版本。要么合並,要么明确登出索引。
分類做完,很多纠结會自然消失:一個站内搜尋结果頁该不该收錄,取决于它属于哪一层,而不是取决于它頁面上有没有寫内容。
核心頁:内鏈、站点地图和更新信号一起给
核心頁的問题通常不是蜘蛛找不到,而是找到了但優先級不够。可以按這個顺序检查:
- 從首頁出發,点多少次能到達這個頁面。层級越浅,越容易被分配到抓取。
- 站点地图里是否只放了希望被收錄的地址。把所有 URL 一股脑塞進去,等于把重要頁面的信号稀释掉。
- 頁面内容更新後,是否有指向它的内鏈同步更新,或者有新的入口把它重新推到抓取路径上。
- 規范連結是否指向自己,站内有没有另一個地址在讲同一件事。
這几條不需要一次做完,但每次上新内容时顺手带上,長期下来比事後补救要省力得多。
聚合與長尾頁:先判断有没有獨立價值
聚合頁最容易出現两種极端:一種是确實能把相關内容组织起来,用戶搜到這個頁面也能得到答案;另一種只是把別處的标题抄了一遍,点進去還得再跳一次。判断标准可以简單一点:如果把這個頁面單獨拿给一個陌生用戶看,他能不能在這里得到答案?能,就按核心頁對待;不能,就有两種處理方式——补充它獨有的内容,或者让它登出索引。
需要注意的是,聚合頁數量往往很大,一旦處理方式不统一,索引里就會混進大量相似頁面。處理时最好按類型批量决策,而不是今天改一個、明天改一個。
功能頁和參數頁:優先從生成入口收口
站内搜尋结果頁、排序參數、會话參數、跟踪參數,這類 URL 的共性問题是可以被無限生成。對它們,屏蔽抓取和禁止索引是两件事:
- 用 robots 屏蔽抓取,可以减少被抓取的數量,但如果頁面被外鏈指向,仍可能以無摘要的形式出現在结果里。
- 用 noindex 需要頁面能被抓取到才能生效,若同时屏蔽了抓取,這個指令往往讀不到。
更根本的做法是控制生成入口:不让篩選组合出現在站内可点击連結里,不让跟踪參數寫進内鏈,减少蜘蛛沿着參數一路往下爬的可能。
定期复盘索引的构成,而不只是看總量
索引總量只是一個數字,更值得看的是它由哪些頁面组成。每隔一段時間,按上面几层分別統計被收錄的頁面比例,大致能看出問题方向:核心頁收錄率低,多半是结构和抓取的問题;功能頁、參數頁占比過高,多半是入口没有收口。
調整之後不要立刻下结论。抓取和索引都有延迟,给一两轮抓取周期再观察,比当天改完当天判断要可靠。
分层的意义不是把頁面分成三六九等,而是让不同角色的 URL 走不同的路径:该被推荐的持續推,该被忽略的尽早收口。