站点的 URL 並不只有頁面。PDF 說明书、白皮书、产品图纸、图片、音视频、压缩包,這些文件同样带着完整的 URL,蜘蛛一旦顺着連結走到就會抓取。其中一部分會進入索引,甚至能直接在搜尋结果里被搜到。做收錄管理时把這些资源一起考虑,比只盯 HTML 頁面更接近真實情况。
被抓到和進索引是两件事
蜘蛛對一個文件的處理流程,大致是:發現 URL、抓取、判断是否值得保留為可检索结果。多數技術文件(CSS、JS、字体、接口返回的 JSON)會被抓取,但不會作為獨立结果進入索引;而 PDF、图片這類有内容可讀的文件,則有更大概率被编入索引。判断的關键通常落在這几点上:
- 可訪問性:返回 200,且没有被 robots.txt 挡住;
- 可解析性:搜尋引擎能從中提取文字或视觉内容,而不是一堆二進制;
- 獨立 URL:文件有稳定地址,不是每次訪問都變的临时連結;
- 可理解的上下文:文件名、标题、所在頁面的文字,能說明這個文件是什么。
PDF 與文档附件的三類常见問题
1. 同一份文档存在多個 URL
文档多次改版、多個栏目各上传一份、带跟踪參數的下载連結被外鏈引用,都容易让同一份 PDF 出現好几個地址。這些地址若都能訪問、内容又一致,就属于重复内容,容易让索引里出現多個版本。處理方式通常是保留一個規范地址,其余做 301,或者至少用 canonical 指明首選版本;歷史留存的舊文件,確認不再需要後可以直接下线。
2. 附件内容與頁面内容高度重叠
常见的情况是:頁面本身已经寫清了全部要点,又額外放了一份内容几乎相同的 PDF 下载。此时 PDF 很难成為獨立的检索结果,反而可能被当作重复内容。如果這份文档只是给用戶留档用,可以考虑不让它進索引(例如對附件目錄設定 X-Robots-Tag: noindex),把索引位置留给頁面本身。
3. 缺少入口和上下文
有些文档只存在于服務器目錄里,靠 sitemap 或歷史外鏈被蜘蛛發現,頁面上没有任何連結指向它。這類文件即使被抓到,也缺少标题、摘要所需的信息,收錄後效果通常不理想。更稳的做法是在相關頁面里加上自然入口,用一两句话說明文档内容,而不是單纯甩一個下载連結。
图片與媒体文件的處理
图片走的是图片搜尋的索引通道,規則和網頁不完全一样,但有几件事是共通的:
- 文件名使用可讀的英文或拼音,避免 IMG_2031 這類無意义命名;
- alt 属性描述图片内容,而不是堆關鍵詞;
- 图片所在頁面的正文與图片主题相關,图片才會被放進合适的上下文;
- 大尺寸图、懒加载图要保證蜘蛛能拿到真實地址,避免一張图只有占位符;
- 图片數量多的站点,可以用图片 sitemap 辅助發現。
该不该让附件進索引:一份检查清單
並不是所有文件都值得進索引。判断时可以按顺序問自己几個問题:
- 這個文件有没有獨立检索價值?用戶會不會专门搜尋它的内容?
- 它和站内已有的頁面、文档是否重复?
- 它有没有稳定的 URL 和可讀的标题?
- 它有没有来自頁面的自然入口,而不是孤立的地址?
- 更新频繁的文件,舊版本是否應该下线或重定向?
如果以上大多是否定答案,让它保持在“可被抓取但不必進索引”的狀態,往往更干净。實現方式主要是 robots.txt 限制抓取、X-Robots-Tag: noindex,或對附件目錄做统一策略,而不是逐個文件處理。
把非 HTML 资源当成 URL 生態的一部分来管理:该保留的保留,该合並的合並,该挡在索引外的明确挡住。资源目錄理顺之後,蜘蛛抓取的重点也會更集中到真正需要被搜到的頁面上。