核對收錄时,很多人只盯着 HTML 頁面,但图片、PDF、表格附件、压缩包這類文件同样是獨立 URL,同样可能被抓取、被索引,甚至出現在搜尋结果里。等到發現索引里多出一批這類地址再来處理,返工成本會高不少。
這些文件為什么會進索引
搜尋引擎看待 URL 並不区分後缀。只要一個地址可以被公開訪問,又通過内鏈、目錄列表、Sitemap、外鏈或頁面资源引用等路径被發現,它就有机會進入抓取队列並最终被索引。常见的来源有几類:
- 頁面上直接連結的 PDF 手册、报價表、报名表;
- 上传後没有做訪問控制的图片目錄和附件目錄;
- 站点地图或采集工具自動带上的媒体文件地址;
- 被外部站点轉载、引用时留下的资源直鏈。
先判断:该不该留在索引里
不是所有非 HTML 文件都要清理。判断标准不是“能不能被收錄”,而是用戶通過搜尋找到它时,拿到的是不是一個完整、可用的结果。
通常值得保留的:
- 产品規格书、公開白皮书等本身就有獨立检索需求的资料;
- 能带来图片搜尋流量的主图、示意图;
- 已经做過整理、只保留一個規范版本的附件。
通常建议收拢或清理的:
- 僅作頁面装饰的内部用图、图标切图;
- 同一份资料存在 v1、v2、最终版、最终版2 等多個可訪問版本;
- 後台導出、临时上传、測試用的表格與压缩包;
- 還有對應 HTML 頁面在正常服務、内容高度重复的附件。
附件類资源最常见的問题不是“被抓到”,而是同一份内容有多個版本同时可訪問。先合並入口、留下唯一版本,再谈要不要屏蔽。
核對顺序
- 抽样確認索引狀態。從服務器日誌或上传目錄里挑一批文件地址,逐個查是否已在索引中,而不是凭感觉判断。
- 確認發現路径。如果這些地址只出現在上传目錄里,說明是目錄被遍歷或直鏈传播;如果出現在正文、Sitemap 里,就要先改源头。
- 看有没有對應的 HTML 頁面。如果同一份内容已有正常頁面,附件属于“另一個版本”,優先让頁面成為主入口。
- 决定動作。要保留的,补上規范的連結入口和文件名、說明文字;要移除的,先取消公開可訪問,再考虑索引层面的信号。
- 复核。處理完成後隔一段時間再抽查同一批地址,確認索引狀態确實變化,而不是只看一次。
屏蔽方式別選错
用 robots.txt 的 Disallow 禁止抓取,會让搜尋引擎讀不到頁面上的 noindex 指令,地址可能長期留在索引里,只是摘要無法更新。想從索引中移除,優先使用 noindex 類信号:PDF 可以在 HTTP 响應头里加 X-Robots-Tag,图片同理;同时把文件從公開目錄移走,或改為需要登入才能訪問。
如果两者已经同时用上,先撤掉 Disallow、恢复抓取,等 noindex 生效後再考虑是否重新屏蔽。
核對节奏
這類资源不需要天天查,按季度抽样一次即可,重点關注新上传目錄和活動专题頁带出的附件。核對时把“被發現”和“已收錄”分開记錄,才能判断問题出在連結入口還是索引环节。