網站收錄

站内 PDF 與附件被收錄:先分類,再决定保留、規范化還是清理

下载目錄里的 PDF、表格和图片常被蜘蛛顺鏈抓走並進入索引,很多人第一反應是整目錄屏蔽。本文按對外资料、内部文件、衍生文件、無意义文件四類拆分,给出保留、規范化、屏蔽與清理的判定顺序,並整理狀態碼、robots.txt、sitemap 與内鏈的收口步骤。

網站收錄

站内 PDF 與附件被收錄:先分類,再决定保留、規范化還是清理

很多站点在核對索引量时發現,真正被大量收錄的不是詳情頁,而是下载目錄里的 PDF、Excel、PPT、图片附件,甚至打包的 zip。這些地址往往没有導航入口,只在列表頁以連結形式出現,却能被蜘蛛顺着抓走並進入索引。

遇到這種情况,不建议看到就一律屏蔽。附件本身可能對用戶有價值,也可能承担對外资料传递的作用。比較稳妥的做法是先分類,再决定處理方式。

第一步:先分清附件属于哪一類

  • 對外资料:产品手册、白皮书、說明书、报價單等,本来就想让用戶搜到並下载的。
  • 内部文件:内部培训、會议记錄、临时上传、工單附件等,不應该對外可见的。
  • 衍生文件:同一份内容既有網頁版又有 PDF 版,PDF 只是打印或導出用的。
  • 無意义文件:測試上传、空模板、随机命名的文件、反复上传的舊版本。

第二步:按類型确定處理方向

對外资料:保留,但要补上規范

這類文件可以收錄,前提是让它有一個明确的“身份”,而不是一個孤零零的文件地址。

  • 重要附件配一個獨立的落地頁,寫清标题、简介、用途和更新日期,下载連結放在頁面里。
  • 頁面上标注文件大小、頁數、版本号,减少用戶下载後才發現不是想要的内容。
  • 同一份内容既有網頁版又有 PDF 时,選一個作主版本,用 canonical 指向網頁版,PDF 留在服務器上供下载。

内部文件:屏蔽的同时要改入口

不要在 sitemap 里提交,robots.txt 屏蔽對應目錄只是第一步,更關键的是把文件移出公開目錄或加上訪問控制。已经進入索引的地址,先確認服務端返回 404、403 或加上 noindex,再走後續的移除流程。

robots.txt 只能阻止繼續抓取,不能刪除已经建立的索引條目。想让地址從索引里消失,通常需要頁面返回可识別的狀態碼,或给出明确的 noindex 信号。

衍生文件:合並,不要两份都留

同一内容的 PDF 版和網頁版同时被收錄,很容易造成重复。保留網頁版用于收錄,PDF 用于下载,两者的标题和摘要做出区分,避免完全相同的标题同时出現在索引里。

無意义文件:直接從源头清理

測試文件、舊版本、随机命名文件,能從服務器刪除的就刪除並返回 404。數量大的目錄可以整体屏蔽抓取,同时回头看上传流程,避免繼續产生同類文件。

第三步:收口顺序

  1. 導出附件地址清單,用日誌、sitemap、site 查询三條路径交叉核對。
  2. 按上面四類逐個打标簽,标出必须保留的部分。
  3. 處理服務端狀態:内部文件返回 404 或加訪問限制。
  4. 更新 robots.txt 與 sitemap:保留的附件补落地頁入口,屏蔽的不再提交。
  5. 更新内鏈:把直接指向文件的連結改成指向落地頁。
  6. 观察一段時間,用日誌看抓取频次是否下降,用 site 查询看索引條目是否减少。索引更新有延迟,不要频繁反复操作。

几個容易踩的坑

  • 只在 robots.txt 里 Disallow,索引里還留很久,于是誤以為處理無效。
  • 把下载目錄整目錄屏蔽,结果连對外资料的落地頁也一起被挡。
  • sitemap 里提交了成千上萬個附件地址,等于主動邀請蜘蛛去抓。
  • 同一份材料反复導出多個版本,版本号不同但内容一致,形成新的重复。

附件被收錄本身不是错誤,問题在于你有没有對它們做過明确判断。先分類,再决定保留、規范化還是清理,比看到一堆文件就通通屏蔽要稳得多。