很多站点在改版、上新栏目或者做活動时,會顺手在正式目錄下建一批临时頁面:新模板的预览頁、還没寫完的草稿、内部用的統計頁、给客戶看的演示頁。這些頁面在浏览器里能正常打開,也很容易被搜尋蜘蛛顺着内鏈、導航、站点地图或者日誌里的地址抓走。它們往往缺标题、缺描述、缺正文结构,一旦被索引,用戶搜到的是半成品,同时也會分散站点的抓取资源。
半成品頁面一般從哪些入口漏出去
- 導航與頁脚:測試栏目被临时挂到主導航或頁脚,全站頁面都带上了這個連結。
- 内鏈與推荐位:文章正文、侧栏推荐、相關阅讀里手動贴過測試地址,事後没有清理。
- 站点地图與 RSS:生成工具按目錄掃描,把 test、demo、tmp 這類目錄一並寫進 sitemap。
- 站内搜尋與篩選參數:搜尋頁會生成带參數的地址,把草稿内容也拼進列表。
- 目錄直连與备份文件:服務器上遗留的压缩包、舊版頁面、編輯器临时文件可以被直接訪問。
自查怎么做
- 先列清單。用站内搜尋和外部检索把可疑地址集中起来;再翻一遍最近三個月的抓取日誌,看蜘蛛是否訪問過 /test、/demo、/tmp、/draft 這類路径。
- 確認狀態。能公開訪問、返回 200 的頁面才是需要處理的;已经返回 404 或 403 的记錄一下即可。
- 看有没有入鏈。查一下站内哪些頁面連結到這些地址,尤其是導航、頁脚和公共模板文件。
- 查索引情况。確認這些地址是否已被搜尋引擎收錄,是否出現在搜尋结果里。
- 记錄影响范围。判断是單個頁面外泄,還是模板級、目錄級的問题,方便决定處理方式。
處理方式:能删就删,删不掉就挡
临时頁面已经上线
優先考虑刪除或下线,把地址收敛到正式頁面。如果内容還值得保留,就把它整理成正常頁面,配上标题、描述和完整结构,再谈是否放出去。不要让它以半成品狀態長期停留在索引里。
還没公開的草稿和測試目錄
把它移到 Web 根目錄之外,或者加訪問密碼;确實需要放在站点内,可以用 robots.txt 屏蔽目錄,並在頁面层級加上 noindex。注意這两件事要分開做:robots.txt 挡的是抓取,meta noindex 负责不索引。只做前者的话,頁面仍可能因為外鏈被收錄成缺少描述的结果。
顺手把入口堵上
- 站点地图和 RSS 的生成規則里排除測試、草稿、临时目錄。
- 模板里的導航、頁脚、推荐位不要出現測試地址,改完记得全站回归一遍。
- 站内搜尋頁和篩選頁加 noindex,避免生成大量參數地址。
- 服務器上清理压缩包、舊版本目錄和編輯器临时文件,關閉目錄列表功能。
抓取资源是有限的。让蜘蛛把時間花在真正的栏目和内容頁上,比让它反复爬測試目錄更有價值。
把检查放進日常流程
上线前多看一眼有没有残留測試連結,改版时把舊目錄一並處理,定期從日誌里抽查蜘蛛的訪問路径。發現外泄頁面後,先判断是删、是挡還是补全内容,再動手。處理完隔一段時間复查日誌和收錄情况,確認這些地址没有再被反复抓取。
這類問题本身不难處理,麻烦的是拖。半成品頁面躺得越久,被外鏈引用、被镜像搬运、被搜尋结果收錄的机會就越多,清理成本也就越高。