做 site 查询时,除了正常的栏目頁和文章頁,有时會看到一些意料之外的地址:图片目錄、上传的 PDF、接口返回的 JSON,甚至一個只有文件列表的目錄頁。這些非 HTML 资源同样可能進入索引,只是它們所處的索引位置和影响方式與網頁不完全一样。搞清楚這一层,再决定哪些该留、哪些该處理,比一上来就屏蔽整個目錄更稳妥。
先分清抓取和收錄不是同一件事
搜尋蜘蛛請求一個 URL,只代表它拿到了内容,不代表這個 URL 會進入索引。是否收錄,還取决于资源類型、内容是否有獨立價值、有没有被規則挡住。图片、PDF 這類资源被抓取的比例很高,但真正進入索引的,通常是那些能被獨立搜尋、並且有足够上下文說明它是什么的资源。
哪些非 HTML 资源會進入索引
- 图片:JPG、PNG、WebP 等,進入的是图片索引,出現在图片搜尋结果里。
- 文档:PDF 及部分 Office 文档,進入網頁索引,可以像普通頁面一样被搜到。
- 音视频:單獨的视频文件或播放頁,處理方式介于两者之間。
- 接口與資料文件:JSON、XML、CSV 被直接訪問时,也可能被当作内容處理。
- 目錄列表:服務器未關閉索引时,會生成一個可被抓取的連結列表頁。
图片收錄:進的是图片索引,不占網頁索引位
图片本身不會以網頁的形式出現在搜尋结果里,它進入的是图片搜尋。常见的影响因素是文件名是否有意义、alt 文本是否描述准确、图片周围有没有相關文字。如果站点有大量图片流量,這部分值得保留;但由參數生成的缩略图、水印图、不同尺寸副本,容易造成同一張图出現大量重复版本,属于可以收敛的部分。
PDF 與附件:容易被忽略的索引入口
上传到 /uploads/ 或 /files/ 目錄下的报價單、說明书、活動手册,只要連結被爬到,就可能被收錄並出現在搜尋结果中。這類内容的麻烦通常有两点:一是版本迭代後舊文件仍留在索引里,用戶搜到的是過期版本;二是文件里可能包含当时無意公開的信息。定期检查這些目錄,比事後补救容易得多。
需要清理时的處理顺序
- 先判断它是否真的有害:能带来图片或文档搜尋流量的资源,未必要動。
- 能刪除的直接刪除,返回 404 或 410,让索引自然收缩。
- 不希望被抓取的整块目錄,用 robots.txt 屏蔽,减少持續抓取。
- 對仍可訪問但不想收錄的單個文件,用 X-Robots-Tag 响應头加 noindex。
- 處理完後检查站内是否還有指向這些地址的連結,尤其是舊文章和下载頁。
注意:robots.txt 屏蔽之後,搜尋引擎無法再抓取该文件,也就讀不到 noindex,已经收錄的條目可能長期停留在索引里。如果目标是让某個文件离開索引,通常先允许抓取並返回 noindex,等它消失後再考虑屏蔽目錄。
站点运营上的取舍
非 HTML 资源的收錄不是單纯的技術問题,而是内容策略問题。图片和 PDF 可以带来搜尋流量,也可能是重复内容的来源。一個比較稳的做法是:對外發布的文档统一放在固定目錄,命名带版本和日期;缩略图、裁剪图這類派生资源统一放在一個不對外的目錄,並在模板层面控制它不被内鏈引用。
自查清單
- 用 site 查询配合图片搜尋,看看有哪些资源已经在索引里。
- 检查上传目錄是否開啟了目錄列表。
- 確認關键 PDF 的版本是否唯一,舊版本是否已下线。
- 检查 robots.txt 與 noindex 的配合是否符合预期。
- 记錄一次處理前後的索引變化,作為下次改動的參考。
這類资源平时不顯眼,但數量一旦上来,會明顯影响索引的整体质量和更新节奏。定期看一眼,比出了問题再回头找要省事。