辛苦写完一篇内容,过几天去搜,自己这篇文章没出现,反倒是另一个站的同一份内容排在前面。遇到这种情况,先别急着下“被抄了”的结论,把顺序理清楚,能做的事比想象中多。
先分清三种不同的情况
- 对方确实是搬的。正文一字不差,只换了标题和配图,发布时间还比你的页面晚。这是最典型的采集。
- 两边都来自同一份素材。比如同一篇投稿、同一份通稿、同一个产品说明,各自发了一遍。这不算谁抄谁,但对搜索引擎来说就是重复内容。
- 你自己的页面其实早已被抓过。只是当时内容还不完整(草稿、缺图、只有框架),搜索蜘蛛记住的是那一版。后来补全了正文,索引里仍旧是旧的印象。
三种情况处理方式不一样,先确认再动手,可以省下很多无效操作。
为什么“别人先收录”会发生
收录顺序不完全由发布时间决定,更多取决于搜索蜘蛛什么时候爬到,以及它那一次看到的正文有多少。
- 抓取频率差异。更新频繁、服务器响应稳定的站点,蜘蛛来得勤;新站或更新间隔很长的站,可能要等更久。
- 页面可访问性。自己页面如果加载慢、正文要等脚本渲染后才出现、或者关键段落藏在折叠区域,蜘蛛第一次看到的内容可能不完整。
- 页面上的日期只是自己说的。它可以作为参考,但不是唯一判断依据。抓取记录和首次被发现的记录往往更关键。
自己能做的几件事
- 确认页面是“可被完整抓到”的。正文尽量直接写在 HTML 里,不要只靠前端渲染;重要段落不要放在必须点击才展开的位置。
- 发布后尽快让它被看到。更新站点地图里的更新时间字段,用站长平台的提交入口提交这条 URL,同时从首页或栏目页给一条内链。三件事一起做,比只提交 sitemap 更有意义。
- 把首发时间写清楚。正文附近标明发布时间,配合页面本身的更新记录,让先后关系有据可查。
- 正文里留下自己的痕迹。数据、案例、图片、表格、自己的结论,这些是搬运方最容易丢掉的部分,也是两个版本区分开的依据。
- 确认 canonical 指向自己。站内如果出现多个版本,要统一指向首发那一条,避免自己先分散成好几份。
跨站的 canonical 不要指望太多
在自己页面里加一条指向对方地址的 canonical,等于告诉搜索引擎“以对方为准”,这显然不是想要的结果;反过来,在自己页面写 canonical 指向自己,对别人的页面也没有约束力。跨站 canonical 更像是一条建议,对方不接受就不会生效。
几种常见但没什么用的做法
- 在正文里写“本文为原创,禁止转载”。这句话对搜索蜘蛛没有约束力,也不会改变索引结果。
- 反复改标题、堆关键词,希望盖过对方。标题频繁变动反而会让索引来回更新。
- 自己也去别的站把全文再发一遍,指望“多发几处总有一处排前面”。结果只是又多了一个重复版本,分散判断。
- 把原页面删掉再重发。旧地址积累的抓取记录和链接都会受影响,通常得不偿失。
判断先后关系时,抓取记录和首次被发现的记录,比页面上的日期更值得参考。改动之前先留一份记录,改完之后才有对比的依据。
长期怎么减少这种情况
被搬运本身很难完全避免,能控制的是“被搬运之后,哪一版更容易被认作原始版本”。
- 保持稳定的更新节奏,让蜘蛛知道这个站会持续有新内容出现。
- 把正文写得有具体信息:数据、时间、案例、自己的照片或图表。
- 重要页面之间做好内链,让它在站内不是一个孤零零的地址。
- 给收录情况做一份简单记录:URL、发布时间、首次被抓时间、当前索引状态。出问题时至少有据可查。
如果确实是采集站整篇搬运,可以通过站长平台或对方的联系方式反馈,但不必把全部精力放在这件事上。把自己的页面做扎实、让它持续被稳定抓取,通常比一次投诉更管用。