做收錄核對时,多數人只盯着 HTML 頁面,但图片、PDF、Office 附件、音视频文件同样有獨立 URL,同样會被蜘蛛抓取。它們不參與常規網頁排名,却可能出現在图片结果、文件直鏈或下载類结果里。当你在搜尋里看到一份内部报表、一張临时截图时,問题通常不在頁面模板,而在附件目錄、响應头和入口連結上。
先確認索引里的到底是什么
不同资源類型的成因不一样,先分類,後面的處理才不會用错工具。
- 图片结果:通常来自頁面内的 img 标簽、图片 sitemap 或 CDN 上的可公開訪問路径,常见于产品图、插图、缩略图。
- PDF 直鏈:說明书、白皮书、报價單這類文件被内鏈指向後,容易被單獨抓取,並带着文件内的标题被索引。
- 附件與導出文件:後台導出的表格、临时生成的报表、上传後未清理的舊文件,往往是被動暴露的一類。
- 音视频與其他格式:播放頁之外的源文件地址如果可以直接訪問,也属于同一類問题。
哪些非 HTML 资源可以保留
並不是所有附件都该收口。产品說明书、公開的資料文件、帮助中心里被正常引用的 PDF,本身就是内容的一部分,它們被索引是合理的。判断标准可以简單一些:這個文件如果被用戶直接搜到,是否仍然成立、是否仍然是最新版本。
如果答案是肯定的,重点就放在版本更新和文件内的元信息上,而不是想办法让它消失在索引里。比較常见的問题是舊版本說明书還在,而新版本已经替換了頁面連結,两邊同时存在。
不该出現在索引里的附件
這類文件的共同点是:本来是给内部或特定流程用的,却因為放在可公開訪問的目錄下而被抓走。
- 後台導出的报表、對帳單、名單類文件;
- 測試阶段上传的样張、占位图、临时压缩包;
- 按日期或随机字符串生成的临时目錄下的文件;
- 带有内部參數或未脱敏信息的文档。
核對顺序:從响應头查到入口
- 先划定范围。用站内查询加上服務器日誌,把被索引的非 HTML URL 列出来,按目錄归類,比逐個處理快得多。
- 检查响應头。非 HTML 文件没法加 meta 标簽,控制手段主要是 X-Robots-Tag。確認這個头是否真的回传到了文件本身,而不是只加在了 HTML 頁面上。
- 检查 robots.txt。Disallow 能阻止抓取,但已经進入索引的 URL 不會因此自動消失,反而可能因為抓不到而無法讀取 noindex。需要移除时,先让頁面可抓取並返回 noindex,或者直接返回 404 / 410。
- 检查 sitemap。有些站点會把附件目錄整体寫進 sitemap,或者由生成工具自動收錄所有上传文件。這類提交等于主動告诉蜘蛛来抓,需要單獨筛一遍。
- 检查内鏈與下载按钮。很多附件之所以被抓,是因為頁面上的下载連結直接指向文件地址。改成带說明的落地頁,或者加一层權限校驗,通常比事後收口更省事。
- 检查 CDN 與回源配置。源站加了限制,邊缘节点仍可能保留可公開訪問的副本,两邊規則要一致。
几個容易弄反的细节
Disallow 與 noindex 同时用
這是最常见的顺序错誤。Disallow 會阻止蜘蛛讀取文件里的規則,noindex 也就無從生效,结果是 URL 長期留在索引里。正确做法是:需要移除的,先允许抓取並给出 noindex;确實要長期屏蔽的目錄,再考虑整体 Disallow。
舊附件目錄没清干净
上传目錄按年份或月份分文件夹时,舊目錄常常只從頁面撤了連結,文件本身還在。連結断了,URL 却仍然可訪問,收錄狀態也就一直挂着。
文件内部也带信息
PDF 的作者、标题、内嵌連結都可能被抓取並用于结果展示。整理文件时顺手確認這些字段,比事後改标题更有效。
记錄观察节奏
非 HTML 资源的索引變化比 HTML 頁面更慢,也更容易受缓存影响。建议把處理動作和日期记在同一張表里,按目錄分批观察,而不是每天查一次就下结论。如果一批文件同时被收口,其余目錄的狀態可以顺带核對,避免同類問题反复出現。
把附件当成頁面来管理:有入口、有版本、有归属目錄。規則清晰之後,收錄核對就只剩下確認执行到位。