网站收录

打印页、PDF 与 AMP 版本被收录:同一内容多份副本的收敛顺序

同一篇内容常会以打印页、PDF、AMP 等副本形式存在,只要能被抓取并返回正常状态,就可能各自被收录。本文给出判断主版本的依据、不同类型副本的处理方式,以及从内链、规范标签到状态码的核对顺序,帮助把分散的副本收敛到一个稳定地址。

网站收录

打印页、PDF 与 AMP 版本被收录:同一内容多份副本的收敛顺序

同一篇内容,除了正常的详情页地址,往往还会以别的形式存在:打印版、导出 PDF、AMP 或简版、被工具生成的镜像页。只要这些地址能被抓取、返回 200、内容与正文高度一致,就有机会进入索引,形成多份副本。它们不一定立刻有害,但会分散权重、占用索引名额,也让后续的统计和判断变得困难。

先判断哪一份是主版本

处理副本之前,先明确唯一的主版本地址,再让其他版本向它收敛。判断依据通常有三点:

  • 流量与外部引用:外链、分享、搜索结果里出现最多的那个地址,改动成本最低。
  • 内容完整度:正文齐全、图片可看、导航可用的那份更适合当主版本。
  • 技术可控性:主版本应是你自己能维护模板的地址,而不是第三方生成的页面。
如果两个地址各有各的入口流量,不要急着 301 到其中一个,先看两者的内容与结构差异,再决定是合并还是保留。

三类常见副本的处理方式

打印版与导出页

打印页通常由模板自动生成,正文一致但缺少导航和内链。若访问量极低,可以直接在服务端返回 410 或 404,同时在模板里取消对爬虫的入口;如果确实有用户使用,则保留页面但加上指向主版本的 canonical,并在 robots 中限制抓取(注意不要连带屏蔽 CSS、JS 等渲染资源)。

PDF 与其他下载格式

PDF 被索引是常见现象。若 PDF 只是同一篇文章的导出文件,且页面已存在,可以在下载链接上加 nofollow,或改为提交表单形式;已经收录的 PDF,可通过 301 跳回对应 HTML 页,或在无法跳转时用 X-Robots-Tag 的 noindex 让其自然退出。若 PDF 本身是独立资料,建议补充唯一标题、简介和来源页链接,让它有自己的价值,而不是继续做正文的影子。

AMP、简版与镜像站

AMP 或移动简版如果与主页面内容一致,应按建议用 canonical 指向主版本;镜像站、采集站属于外部副本,能联系就联系,联系不上则优先保证自己主版本的可抓取与更新频率。

一套可执行的核对顺序

  1. 用 site: 指令或日志确认副本地址是否真的进入索引,别凭印象处理。
  2. 列出每个副本的访问路径:是内链、站内搜索,还是第三方引用带来的。
  3. 从内链和 sitemap 中移除指向副本的入口,保留指向主版本的链接。
  4. 按副本类型选择处理动作:canonical、301、noindex 或直接下线,尽量只选一种,避免叠加。
  5. 改完后在日志里观察副本的抓取频次是否下降,主版本的抓取与展示是否稳定。
  6. 索引更新有延迟,几周内不要反复改动同一组地址。

容易踩的两个坑

  • canonical 指向的地址本身也要能被抓取,如果它返回错误状态,收敛信号会被忽略。
  • 用 robots.txt 屏蔽副本,同时又希望 noindex 生效——被屏蔽的页面无法读取 noindex,两者通常只能选一个。

多份副本不是必须立刻清除的错误,而是需要排序的同类页面。把主版本固定下来,让内链、规范标签和状态码指向同一个方向,剩下的交给抓取与索引周期去消化。