站点运营

站点运营:清理草稿與预览連結,別让半成品頁面提前收錄

草稿頁、预览連結和測試地址经常在發布流程中被漏掉,它們内容不完整、标题重复,却可能被搜尋引擎發現並占用抓取资源。本文梳理這些地址的常见来源、自查方法,以及按頁面去留分三類處理的具体做法,並给出几個容易踩的坑。

站点运营

站点运营:清理草稿與预览連結,別让半成品頁面提前收錄

很多站点的草稿、预览、測試頁面並不是因為被谁刻意發布才出現在搜尋结果里,而是發布流程中留下的临时連結被外部拿到,或者測試环境没有做任何訪問限制。這些頁面往往内容不完整、标题重复、图片缺失,一旦被搜尋引擎發現,既占用了抓取资源,也可能和正式頁面争抢同一批關鍵詞。

草稿頁通常從哪里漏出去

先別急着改代碼,先想清楚這些地址是怎么产生的。常见来源大致有這几類:

  • CMS 自動生成的预览地址,通常带 token、post_id 之類的參數,複製粘贴就能訪問;
  • 未發布的文章固定連結仍然可以打開,只是没有入口,很多人以為這样就等于不存在;
  • 測試域名或 staging 子域没有做登入限制,且内容和主站一致;
  • 上传目錄、導出文件、备份压缩包放在可以直接訪問的路径下;
  • 編輯把预览連結發给外部同事或客戶,連結被轉發、被複製,最终被別人抓到。

前两類属于自己站点的問题,後三類則往往和訪問權限、目錄規划有關,處理方式不太一样。

先確認哪些地址真的在外面

只凭印象判断容易漏項,建议按下面几步過一遍:

  1. 在搜尋引擎里用 site: 加自己的域名,再搭配草稿相關的路径關鍵詞,看看有没有不该出現的頁面(自己查即可,不要反复刷);
  2. 翻服務器訪問日誌,找那些本该没人訪問的路径,留意是否有搜尋引擎爬虫的 UA 来過;
  3. 检查 sitemap 與站内連結,確認没有把草稿地址寫進去;
  4. 检查 robots.txt,尤其是不允许抓取的目錄列表,確認没有把整個測試目錄誤寫進允许范围;
  5. 用無痕窗口訪問這些地址,確認是否需要登入或密碼。

處理方式按頁面去留分三類

已经不需要的頁面

如果草稿内容确定不會再發布,最干净的做法是让服務器直接返回 404,並確認文件已经真正刪除,而不是只把連結從導航里拿掉。頁面還在、只是没有入口,對爬虫来说仍然是可訪問的。

還需要繼續編輯的頁面

這類頁面建议加 noindex 标记,同时限制訪問。這里有個顺序問题:noindex 需要頁面能被正常抓取到才能被讀到,如果 robots.txt 直接把整個目錄 Disallow,爬虫拿不到 noindex,地址仍然可能以纯 URL 的形式出現在结果里。所以更稳妥的顺序是先允许抓取、让頁面返回 noindex,等確認不再出現後,再考虑是否收紧抓取范围。

预览連結已经變成正式内容

如果预览地址對應的内容最终正式發布了,把预览地址 301 到正式地址,同时更新 sitemap 和内鏈,避免舊地址繼續被訪問到一份過时版本。

几個容易忽略的坑

  • 密碼保護不等于不會被看到。加了密碼的頁面,URL 和标题仍有可能被记錄下来,只是用戶点進去看不到正文。
  • 带 token 的预览連結等同于公開地址。一旦被轉發出去,token 就不再是保護措施。
  • 測試域名的風險比單個草稿頁大得多。整站副本如果都没有 noindex,等于凭空多出一套重复内容。
  • 备份文件和導出的資料库放在可訪問目錄下,風險比草稿頁更高,發現後應第一時間移除並更換相關凭據。
  • 站内搜尋结果頁、标簽聚合頁有时會自動把草稿标题拼進去,這類間接泄露容易被忽略。

把检查放進日常流程

  1. 發布前確認预览連結的訪問范围,能設定有效期就設定;
  2. 每次批量導入、改版或迁移後,跑一遍站点地址清單,而不是只看首頁;
  3. 定期翻日誌中的異常路径,重点關注来自外部的訪問;
  4. 把“临时連結怎么處理、谁负责收尾”寫進編輯規范,避免每次靠人记得。
草稿頁的問题通常不在于技術有多复杂,而在于發布流程里没人负责收尾。

把上面几項做成一份简單的清單,每個月抽半小时過一遍,比起事後到處找原因要省事得多。