先分清是哪一种情况
发现自己的内容出现在别的域名下,第一反应通常是「被抄袭了」,但处理方式取决于它属于哪一类。三类现象的应对路径并不相同。
- 整站镜像:域名不同,路径、模板、栏目结构几乎一样,连图片地址都可能原样指向你的服务器。这类通常是抓取工具或建站程序整站复制的结果。
- 内容采集:只拿走正文,页面模板是对方自己的,标题可能被改写,配图和内链被替换。这类在资讯类站点里最常见。
- 代理或翻译站:内容基本一致但语言或界面被转换,往往带着对方自己的导航和广告。
三类情况的共同点是:搜索引擎看到的是两份高度相似的页面,需要自己判断哪一份是原始出处。判断错了,收录归属就会偏。
为什么对方的页面会先被收录
搜索引擎判断原始出处,并不只看谁先发布,而是综合抓取时间、外链指向、站点整体可信度、页面结构是否完整等信号。以下几种情况会让自己的页面在归属竞争中处于劣势:
- 对方站点抓取频次更高,新内容发布后几分钟就被抓走,而自己的页面还在排队。
- 自己的正文依赖前端渲染,或者被折叠在「展开阅读全文」之后,抓取到的 HTML 里信息不完整。
- 页面没有一个可解析的发布时间,只有一句没有标记的日期文字,机器无法稳定识别。
- 站点同时能用多个域名打开,或者同一篇内容有带参数的多个地址,归属信号被分散。
- 文章发布后长期没有站内入口,只能靠站点地图被发现,而对方的链接已经出现在多个页面上。
这些因素叠加时,即使自己的发布时间更早,归属也可能判给对方。
把原创归属做得更明确
与其盯着对方,不如先把自己这边能控制的信号补齐。下面几项按优先级排列:
- 规范域唯一:确定一个主域名,其余变体用 301 收口,页面 canonical 指向自身地址,且与主域名一致。
- 发布时间可见且可解析:正文里能看到发布日期,同时在结构化数据里标注,两者保持一致。
- 站点地图的更新时间真实:内容有实质修改时再更新 lastmod,不要每次生成都刷成当前时间。
- 新内容尽早获得内链:从首页、栏目页、相关文章模块给出入口,让抓取路径短一些。
- 作者与站点信息保持一致:作者署名、站点名称、联系方式在站内各页面统一,便于判断内容来源。
发现被镜像后可以做的事
确认对方是整站镜像后,可按平台提供的版权或侵权投诉路径提交材料,具体受理范围和结果以平台说明为准。提交前建议先保存证据:自己页面的首次发布时间截图、内容版本记录、后台或账号的发布记录。如果是同一主体名下的多个域名互相镜像,问题通常出在服务器或 CDN 配置上,应当从源头停掉,而不是靠搜索引擎去分辨。
需要避免的做法也很明确:不要在镜像站和自己的站点之间互相刷链接,不要用隐藏文字或隐藏链接「声明原创」,也不要指望提交一次投诉就立刻生效。这些做法既解决不了归属问题,还可能带来新的风险。
收录归属是一个信号累积的结果,不是单点开关。规范域、时间标记、内链入口这几件事做到位,比事后反复投诉更有效。
核对清单
- 站内是否只有一个规范域可以正常访问,其余变体是否已 301。
- 页面 canonical 是否指向自身,并与规范域一致。
- 正文中的发布时间与结构化数据是否一致、可解析。
- 站点地图里的 lastmod 是否反映真实修改时间。
- 新文章发布后,站内是否在当天就有可点击的入口。
- 是否存在依赖渲染、正文首屏缺失的页面模板。
- 发现镜像后,是否已保存原始发布证据并按平台路径提交。
把这几项过一遍,多数归属错位的问题都能找到具体原因,而不是停留在「对方抄我」的判断上。