收錄工作常被当成單向的加法:想办法让頁面進索引。但真正做過一段時間运营就會發現,让頁面干净地登出索引,难度往往更高。常见的問题不是選错了工具,而是把几個工具叠在一起用,结果谁都没生效,頁面卡在一個尴尬的中間狀態。
三種手段,各管一件事
先把机制分清楚,後面的顺序才有意义。
- robots.txt 的 Disallow:只阻止蜘蛛抓取這個 URL,並不等于让頁面离開索引。如果站外有連結指向它,它仍可能以“無摘要”的形式出現在结果里。
- noindex:寫在頁面的 meta 标簽里,或放在 HTTP 响應头的 X-Robots-Tag 中。它必须被蜘蛛抓到才能讀到,所以頁面不能被 robots.txt 挡住。
- 返回 404 或 410:頁面本身消失。蜘蛛抓到後,索引里的條目會逐步清理,410 表達的信号比 404 更明确。代價是站内残留入口會让蜘蛛反复請求無效地址。
- 301 跳轉:适合内容迁移或頁面合並,把權重導向替代頁,不是用于“單纯下架”的手段。
顺序错了會怎样
下面几種情况在實际站点里很常见:
- 先给目錄加了 robots.txt 禁止,再给頁面加 noindex。结果 noindex 永遠讀不到,索引里可能長期留着一條無摘要记錄。
- 直接删掉頁面,但站内連結、導航、站点地图都没清理。蜘蛛持續撞到 404,抓取预算被白白消耗。
- 頁面已经 noindex,却還留在 sitemap 里,两個信号互相矛盾,處理時間被拉長。
- 只改了詳情頁模板,忘了分類頁、标簽頁、作者頁用的是同一套 meta。
noindex 需要被抓取才能被讀到,robots.txt 恰恰阻止抓取。這两步顺序颠倒,頁面就會停在最难看的狀態:既没被移除,也没有有效内容可展示。
一個可执行的登出顺序
- 先定目标:是临时下架、永久移除,還是把内容合並到別的頁面。目标不同,手段完全不同。
- 要合並就走 301:指向主题最接近的替代頁,同时更新站内連結和站点地图。
- 要移除就先断入口:撤掉内鏈、導航和 sitemap 中的地址,避免蜘蛛反复發現它。
- 再上 noindex:用 meta 或 X-Robots-Tag 标记,並確認该 URL 没有被 robots.txt 挡住。
- 观察一段時間:等索引條目减少後,再决定是否需要返回 410,或保留一個简短的說明頁。
- 大批量處理要分批:一次改几千個 URL,日誌里的信号會變得难以解讀,很难判断哪一步起了作用。
怎么確認它真的登出了
- 用站点查询和 URL 检查工具看该地址目前的狀態,两邊的口径未必一致,別只看一個。
- 看抓取日誌:如果蜘蛛還在频繁請求,說明站内還有入口没断干净。
- 看站点地图文件:已经 noindex 的地址不應该繼續出現在里面。
索引更新本身有延迟,通常是几周甚至更久。一两天没變化很正常,此时最忌讳的是叠加新手段——比如又加 robots 又加 404,把狀態搅得更难判断。一次只改一個變量,观察清楚再動下一步,比一次性做全套更有效。