同一篇内容,除了正常的詳情頁地址,往往還會以別的形式存在:打印版、導出 PDF、AMP 或简版、被工具生成的镜像頁。只要這些地址能被抓取、返回 200、内容與正文高度一致,就有机會進入索引,形成多份副本。它們不一定立刻有害,但會分散權重、占用索引名額,也让後續的統計和判断變得困难。
先判断哪一份是主版本
處理副本之前,先明确唯一的主版本地址,再让其他版本向它收敛。判断依據通常有三点:
- 流量與外部引用:外鏈、分享、搜尋结果里出現最多的那個地址,改動成本最低。
- 内容完整度:正文齐全、图片可看、導航可用的那份更适合当主版本。
- 技術可控性:主版本應是你自己能维護模板的地址,而不是第三方生成的頁面。
如果两個地址各有各的入口流量,不要急着 301 到其中一個,先看两者的内容與结构差异,再决定是合並還是保留。
三類常见副本的處理方式
打印版與導出頁
打印頁通常由模板自動生成,正文一致但缺少導航和内鏈。若訪問量极低,可以直接在服務端返回 410 或 404,同时在模板里取消對爬虫的入口;如果确實有用戶使用,則保留頁面但加上指向主版本的 canonical,並在 robots 中限制抓取(注意不要连带屏蔽 CSS、JS 等渲染资源)。
PDF 與其他下载格式
PDF 被索引是常见現象。若 PDF 只是同一篇文章的導出文件,且頁面已存在,可以在下载連結上加 nofollow,或改為提交表單形式;已经收錄的 PDF,可通過 301 跳回對應 HTML 頁,或在無法跳轉时用 X-Robots-Tag 的 noindex 让其自然登出。若 PDF 本身是獨立资料,建议补充唯一标题、简介和来源頁連結,让它有自己的價值,而不是繼續做正文的影子。
AMP、简版與镜像站
AMP 或移動简版如果與主頁面内容一致,應按建议用 canonical 指向主版本;镜像站、采集站属于外部副本,能联系就联系,联系不上則優先保證自己主版本的可抓取與更新频率。
一套可执行的核對顺序
- 用 site: 指令或日誌確認副本地址是否真的進入索引,別凭印象處理。
- 列出每個副本的訪問路径:是内鏈、站内搜尋,還是第三方引用带来的。
- 從内鏈和 sitemap 中移除指向副本的入口,保留指向主版本的連結。
- 按副本類型選擇處理動作:canonical、301、noindex 或直接下线,尽量只選一種,避免叠加。
- 改完後在日誌里观察副本的抓取频次是否下降,主版本的抓取與展示是否稳定。
- 索引更新有延迟,几周内不要反复改動同一组地址。
容易踩的两個坑
- canonical 指向的地址本身也要能被抓取,如果它返回错誤狀態,收敛信号會被忽略。
- 用 robots.txt 屏蔽副本,同时又希望 noindex 生效——被屏蔽的頁面無法讀取 noindex,两者通常只能選一個。
多份副本不是必须立刻清除的错誤,而是需要排序的同類頁面。把主版本固定下来,让内鏈、規范标簽和狀態碼指向同一個方向,剩下的交给抓取與索引周期去消化。