很多站点在核對索引量时發現,真正被大量收錄的不是詳情頁,而是下载目錄里的 PDF、Excel、PPT、图片附件,甚至打包的 zip。這些地址往往没有導航入口,只在列表頁以連結形式出現,却能被蜘蛛顺着抓走並進入索引。
遇到這種情况,不建议看到就一律屏蔽。附件本身可能對用戶有價值,也可能承担對外资料传递的作用。比較稳妥的做法是先分類,再决定處理方式。
第一步:先分清附件属于哪一類
- 對外资料:产品手册、白皮书、說明书、报價單等,本来就想让用戶搜到並下载的。
- 内部文件:内部培训、會议记錄、临时上传、工單附件等,不應该對外可见的。
- 衍生文件:同一份内容既有網頁版又有 PDF 版,PDF 只是打印或導出用的。
- 無意义文件:測試上传、空模板、随机命名的文件、反复上传的舊版本。
第二步:按類型确定處理方向
對外资料:保留,但要补上規范
這類文件可以收錄,前提是让它有一個明确的“身份”,而不是一個孤零零的文件地址。
- 重要附件配一個獨立的落地頁,寫清标题、简介、用途和更新日期,下载連結放在頁面里。
- 頁面上标注文件大小、頁數、版本号,减少用戶下载後才發現不是想要的内容。
- 同一份内容既有網頁版又有 PDF 时,選一個作主版本,用 canonical 指向網頁版,PDF 留在服務器上供下载。
内部文件:屏蔽的同时要改入口
不要在 sitemap 里提交,robots.txt 屏蔽對應目錄只是第一步,更關键的是把文件移出公開目錄或加上訪問控制。已经進入索引的地址,先確認服務端返回 404、403 或加上 noindex,再走後續的移除流程。
robots.txt 只能阻止繼續抓取,不能刪除已经建立的索引條目。想让地址從索引里消失,通常需要頁面返回可识別的狀態碼,或给出明确的 noindex 信号。
衍生文件:合並,不要两份都留
同一内容的 PDF 版和網頁版同时被收錄,很容易造成重复。保留網頁版用于收錄,PDF 用于下载,两者的标题和摘要做出区分,避免完全相同的标题同时出現在索引里。
無意义文件:直接從源头清理
測試文件、舊版本、随机命名文件,能從服務器刪除的就刪除並返回 404。數量大的目錄可以整体屏蔽抓取,同时回头看上传流程,避免繼續产生同類文件。
第三步:收口顺序
- 導出附件地址清單,用日誌、sitemap、site 查询三條路径交叉核對。
- 按上面四類逐個打标簽,标出必须保留的部分。
- 處理服務端狀態:内部文件返回 404 或加訪問限制。
- 更新 robots.txt 與 sitemap:保留的附件补落地頁入口,屏蔽的不再提交。
- 更新内鏈:把直接指向文件的連結改成指向落地頁。
- 观察一段時間,用日誌看抓取频次是否下降,用 site 查询看索引條目是否减少。索引更新有延迟,不要频繁反复操作。
几個容易踩的坑
- 只在 robots.txt 里 Disallow,索引里還留很久,于是誤以為處理無效。
- 把下载目錄整目錄屏蔽,结果连對外资料的落地頁也一起被挡。
- sitemap 里提交了成千上萬個附件地址,等于主動邀請蜘蛛去抓。
- 同一份材料反复導出多個版本,版本号不同但内容一致,形成新的重复。
附件被收錄本身不是错誤,問题在于你有没有對它們做過明确判断。先分類,再决定保留、規范化還是清理,比看到一堆文件就通通屏蔽要稳得多。