不少站点會用模板批量生成頁面:不同城市各一頁、不同型号各一頁、不同參數组合各一頁。上线一段時間後常见現象是:少數頁面進了索引,其余長期停在“已發現,尚未编入索引”,或者压根没被稳定抓取。這個时候先去加蜘蛛池、堆外鏈,往往救不回来,因為問题出在頁面本身——它們彼此之間几乎没有区別。
一、先確認是不是真的低差异
判断同质化不要凭感觉,做一次抽样對比更靠谱。從同一批頁面里随机抽 8 到 10 個,把正文主体(去掉導航、頁脚、推荐位、广告位)複製到纯文本里,逐段比對。
- 有三段以上完全一字不差:可以按高度同质處理。
- 只有地名、型号、數字被替換,句式结构一致:属于轻度改寫,實质仍是同一份内容。
- 各自有獨立的資料、說明、問答、注意事項:属于有差异,通常不需要大動。
判断重复不只看字符重合度,還要看這段内容是否只在你這一條 URL 上出現過。別處已经有的段落,即使句式換了,也很难带来增量。
二、把差异拆成三层来判断
1. 主体内容差异
這是最核心的一层。看每個頁面有没有只属于自己的信息:本地價格区間、實际库存與时效、特定型号的規格差异、常见問题的具体答复。如果這些都没有,頁面就只是模板換皮。
2. 结构化資料與參數
參數本身不是内容,但可以让頁面之間形成区分:價格、規格、适用场景、服務范围。前提是這些字段真實、可核對,不能為了“看起来不一样”而编造。
3. 頁面級信号
标题、H1、面包屑、内鏈锚文本是否與頁面主题一致。常见错誤是标题里堆地名和型号,正文却還是通用文案,等于告诉搜尋引擎“這頁没什么可给的”。
三、入口分配:不是所有頁面都值得同等對待
sitemap 全量提交,只代表你愿意让它們被發現,不代表每一個都需要被重点抓取。抓取预算是有限的,把入口集中到差异度高的頁面上,通常比平均分配更有效。
- 按差异度把頁面分成高、中、低三档。
- 高差异頁面:進主要栏目列表、相關推荐、面包屑,保證從首頁出發三跳内可達。
- 中差异頁面:靠 sitemap 加少量内鏈,不做重点推荐位。
- 低差异頁面:先考虑合並或收敛,而不是繼續加内鏈。
四、低差异頁面的几種處理方式
- 合並:把几個高度同质的頁面並成一個,其余做 301 指向主頁面,主頁面再补充各自獨有的信息。
- 收敛:參數组合過多时,只保留有搜尋需求、有獨立價值的组合,其余通過規范連結或參數規則归到主 URL。
- noindex:确實没有獨立價值但需要保留给用戶訪問的頁面,可以用 noindex 阻止進入索引,同时保持可抓取,让爬虫能讀到這個指令。
- 下线:既没有用戶價值也没有搜尋價值的頁面,直接返回 404 或 410,比留在站内当僵尸頁更干净。
這里要分清两件事:noindex 是告诉搜尋引擎“可以抓,但別收錄”;robots.txt 屏蔽是“別来抓”。如果屏蔽了抓取,爬虫讀不到 noindex,索引里的舊记錄反而可能長期留着。
五、改完之後看什么
- 索引报告里按頁面類型分组的變化,而不是只看總索引量。
- 抓取日誌里這批 URL 的出現频次,判断入口調整有没有传導到抓取。
- 這批頁面的自然点击與站内入口点击,判断哪些确實有人用。
观察周期建议按周看,別按天盯。索引和抓取的調整本身就是慢變量,一两天没動静很正常。
六、几個容易踩的坑
- 只改标题和 H1,正文照舊,差异度並没有提升。
- 為了“差异化”把關鍵詞硬塞進正文,可讀性反而下降。
- 同一内容存在多個 URL 變体,却没有做規范化,等于把信号分散掉。
- 把低差异頁面全量塞進 sitemap 和栏目列表,進一步摊薄本来就有限的抓取。
整体思路可以先简單记成一句:先判断差异度,再决定入口,最後才谈收錄。批量頁面的收錄問题,多數不是爬虫不来,而是来了也看不出這一頁和上一頁有什么不同。