網站收錄

PDF、图片和附件也會進索引:非 HTML 资源的收錄處理方式

PDF、图片、Office 文档等非 HTML 资源同样會被抓取和索引,但它們的标题来源、正文提取方式和展示位置都與普通頁面不同。本文梳理這類文件的發現途径、该不该收錄的判断标准,以及從盘点、断鏈到驗證的處理顺序,帮助站点把文件類资源纳入常規收錄管理。

網站收錄

PDF、图片和附件也會進索引:非 HTML 资源的收錄處理方式

谈收錄时,多數人只盯着 HTML 頁面,但搜尋引擎同样會抓取並處理 PDF、图片、Office 文档等非 HTML 资源。這類文件往往藏在内鏈深處或下载目錄里,被收錄後的表現與普通頁面並不一样,處理方式也不能照搬。

非 HTML 资源是怎么被發現的

文件本身不會自己冒出来,蜘蛛找到它們通常有這几條路径:

  • 頁面里的 a 标簽指向文件,蜘蛛顺着連結抓取;
  • sitemap 中列出了文件地址;
  • 站外連結直接指向文件;
  • 服務器開啟了目錄列表,整個目錄被暴露;
  • 文件之間互相引用,比如一份 PDF 里連結另一份 PDF。

其中最容易失控的是後两種。目錄列表和文件互鏈會让一批本不该公開的舊文件被批量發現,而這類地址通常不在任何人的维護清單里。

和普通頁面相比,索引里的差別在哪

  • 文本主要靠文件本身提取。PDF 若是掃描图片拼成,几乎提不出正文,索引里可用的信息非常有限。
  • 标题常取自文件名、文件属性元資料或指向它的連結锚文本,改頁面标题那一套在文件上並不成立。
  • 展示位置不同。图片多出現在图片搜尋,文档可能以文件形式出現在结果里,站点查询不一定能完整列出。
  • 被索引不等于文件被镜像,用戶点击後仍然下载或在线预览原文件。

理解這些差別,才能判断一個文件被收錄後到底有没有價值。

先判断:這個文件该不该被收錄

取舍标准其實和頁面類似,看它是否對用戶有獨立價值、是否只有一個可訪問地址。

  • 该收錄的:产品說明书、白皮书、公開模板、價格表、有獨立意义的图片。
  • 不必收錄的:後台導出資料、内部會议纪要、同一文档的多個舊版本、批量生成的缩略图、临时报表。

處理顺序

  1. 先盘点。用服務器日誌看蜘蛛實际抓了哪些文件類型和目錄,比凭印象列清單可靠得多。
  2. 再决定取舍。需要收錄的,保證文件有可提取文本、命名清楚、被正文連結引用;不需要的,從源头断開:删連結、合並目錄、關閉目錄列表。
  3. 然後處理已進入索引的部分。只删連結往往不够。可以用 X-Robots-Tag 之類的响應头返回 noindex,或對该目錄加訪問限制。需要注意的是,用 robots.txt 屏蔽抓取並不能让已收錄的文件登出索引,因為蜘蛛看不到屏蔽後的内容。
  4. 最後驗證。观察日誌中的抓取變化與站点查询结果。索引清理通常滞後于抓取變化,不要期待当天生效。

几個常见誤操作

把整個下载目錄用 robots.txt 一刀切屏蔽,结果需要被收錄的白皮书也一起消失;或者删掉頁面連結後就不再過問,舊文件長期留在索引里。
  • 文件名全是编号或乱碼,索引中顯示的标题毫無信息量;
  • PDF 是掃描件,正文無法提取,即使收錄也没有可用内容;
  • 同一份文档每季度更新一版,舊版連結没有撤下,索引里堆着多個版本。

观测與驗證

文件類资源的收錄變化,通常在站点查询和索引报告里体現得比較粗糙,需要结合服務器日誌一起看:蜘蛛是否還在請求這些文件、返回什么狀態碼、請求量有没有下降。判断时要留出足够時間,避免因為一两天没變化就反复調整策略。

把非 HTML 资源当成站内内容的一部分来管理,先分清哪些该公開、哪些该登出,再按断鏈、調整响應、看日誌的顺序收尾,比單纯依赖某個配置文件更稳妥。