很多做本地业務的站点會用一套模板批量生成地区頁,标题里換城市名,正文里把地名替換一遍,其余段落几乎完全相同。上线之後常见的情况是:一部分頁面很快進索引,另一部分長期停留在“已發現,尚未编入索引”。這时候先別急着提交或推送,問题往往不在提交動作,而在頁面本身之間的相似度。
先区分抓取、收錄和排名
抓取是爬虫把 HTML 取回去,收錄是搜尋引擎把這個 URL 存進索引库並建立可检索的條目,排名是在已收錄的前提下按查询词排序。三個环节顺序固定,但门槛不同。批量地区頁通常能被抓取——内鏈和站点地图都在——卡住的多半是收錄环节。收錄看的是這個 URL 是否提供了獨立價值:如果它和站内另一個頁面内容几乎一样,搜尋引擎没有理由把两份都收進去。
這類頁面為什么容易被判定為相似
- 除地名外的正文、服務介绍、常见問题、公司信息完全一致;
- 标题和 H1 只有城市名不同,描述也是同一句话換词;
- 頁面之間互相内鏈,形成一批结构相同、内容雷同的頁面群;
- 缺少该地区特有的信息,例如地址、服務范围、案例、價格区間。
搜尋引擎判断重复並不需要正文逐字相同,模板结构、段落顺序、句子模式高度重合时,也會被视為同质内容。同一站点内部出現這種情况,通常称為站内重复内容,處理優先級比跨站轉载更高,因為改動權在自己手里。
先自查,再决定怎么處理
不用复杂工具,可以做几件事:
- 從這批頁面里随机抽 10 個,两两對比正文,把相同段落标出来,估算重复比例;
- 用 site: 查询看這批 URL 有多少已经進了索引,记下數量;
- 查看服務器日誌或搜尋後台的抓取資料,確認爬虫是否正常来訪、是否在反复抓取却不收錄;
- 列出每個頁面能提供的、其他頁面没有的信息,如果列不出来,這個頁面就缺少獨立價值。
處理顺序:合並、差异化、noindex、刪除
按照“先保留價值、再减少重复”的顺序處理,通常比一次性大批量刪除更稳妥:
- 能合並的先合並。如果几個城市可以共用一個服務說明頁,就把它們整合成一個總頁,用锚点或分区区分,其余 URL 做 301 跳轉到總頁。這種方式保留了内容,也减少重复 URL 數量。
- 值得保留的做差异化。有真實业務覆盖的地区,补充本地信息:门店或服務点、覆盖范围、当地案例、常见問题、服務时效。不是加几句地名,而是加只有這個地区才有的内容。
- 暂时不做的先 noindex。地区頁有價值但内容還没补齐时,用 noindex 让它先不參與索引,等补充完成再放開,比直接刪除再重建更省事。
- 确實没有價值的刪除。長期無人訪問、内容無法差异化的頁面,直接返回 404 或 410,並在内鏈和站点地图里同步移除。
注意不要把 noindex 和 robots.txt 混用。robots.txt 屏蔽後爬虫看不到頁面上的 noindex,已收錄的 URL 可能長期留在索引里;要让頁面登出索引,noindex 是更直接的做法。
寫差异化内容时可以抓的几個点
用真實信息替換模板话術
服務時間、响應方式、覆盖区域邊界、常见問题,這些字段各地不同,寫具体比寫漂亮有用。
把本地案例寫清楚
哪怕只有一两個,說明是什么需求、怎么處理、结果如何,比“我們服務過众多客戶”這類表述更有区分度。
避免同一個句式反复出現
批量生成最容易留下的是相同的句式结构,改寫时注意段落顺序和表達方式,不要只替換名词。
几個常见誤区
- 以為提交给搜尋引擎就能收錄——提交只影响發現速度,不改變頁面质量判断;
- 以為改标题就能解决重复——标题只是信号之一,正文同质化仍會被识別;
- 以為參數或大小寫差异能躲開重复判断——URL 變体最终會被收敛;
- 以為收錄數量越多越好——低價值頁面占據索引,反而會稀释整站的抓取和评估。
判断标准很简單:這個頁面拿掉城市名之後,還剩下多少只有它才有的内容。剩下的越少,越應该考虑合並或不让它進索引。
批量頁面不是不能做,但“一套模板換地名”的方式在收錄上越来越难走通。把重复的合並掉,把有價值的寫厚,剩下的交给時間。