站点运营里讨论收錄,大多預設说的是 HTML 頁面。但只要搜尋蜘蛛能抓到的 URL,就不只有網頁這一種。PDF 說明书、产品图、演示视频、压缩包,這些资源同样有自己的地址,也各自有被索引的可能。把它們当成“不算頁面”放任不管,往往會在收錄資料里留下说不清的缺口。
先分清:能被抓取、能被索引、能被展現
一件资源進入搜尋结果,至少要過三關。第一,搜尋蜘蛛要能通過站内入口或外鏈發現這個 URL;第二,服務器返回正常狀態碼和可识別的類型;第三,搜尋引擎愿意把它当作獨立结果呈現。很多非 HTML 资源卡在第三步,不是因為抓不到,而是因為搜尋引擎認為它不值得單獨占一個结果位。
抓取记錄里有它,不代表索引里有它。判断资源收錄情况时,先看抓取记錄,再對照站内资源清單和搜尋表現,不要只凭一次抓取就下结论。
几類资源的實际處理方式
HTML 頁面
最常见也最完整,正文、标题、内鏈都能被解析,是收錄的主体。
PDF 與 Office 文档
搜尋引擎能讀取其中的文字,所以一份结构清晰、有标题的 PDF 是有机會被單獨收錄的。但如果 PDF 只是頁面内容的掃描图,或者正文散乱、没有文字层,收錄價值就很低。更稳妥的做法是:頁面上先放一段 HTML 摘要,PDF 作為附件連結,让用戶和搜尋引擎都有選擇。
图片
图片一般通過图片搜尋收錄。影响它的是文件名、alt 文本、周邊正文和自身尺寸、格式。图片通常不會替頁面本身占一個普通搜尋结果的位子,所以不要指望用图片去补頁面的内容缺口。
视频
视频頁面的收錄取决于周邊文字描述是否充分。只有播放器、没有文字說明的頁面,搜尋引擎很难判断主题。封面图、时長、简介都有帮助。
资源類 URL 的規范同样重要
- 同一份文件被複製到多個目錄,會产生多個可訪問 URL,建议保留一個主地址,其余用 301 或 canonical 归拢。
- 下载連結不要带一堆跟踪參數,否則同一文件會以多種寫法被反复發現。
- 资源 URL 尽量可讀,文件名用英文或拼音,避免纯數字哈希,便于人工排查。
- 被替換掉的舊文件應返回 404 或 410,而不是繼續返回 200 的舊内容。
一個可以照着走的自查顺序
- 列清單:把站内所有非 HTML 的资源類型和相關 URL 明确出来。
- 看狀態碼:確認返回 200、301 還是 404,別让失效文件長期返回 200。
- 看可讀性:PDF 有没有文字层,图片有没有 alt,视频頁有没有文字描述。
- 看入口:资源有没有站内連結可達,還是只能靠外鏈或直接輸入地址訪問。
- 看重复:同一文件是否存在多個 URL 版本,是否需要收敛。
- 看規則與响應头:是否被 robots 規則挡住,或返回了 X-Robots-Tag 之類的指令。
几個容易踩的坑
- 把整個上传目錄放開訪問:大量临时文件、缩略图、备份文件被搜尋蜘蛛發現,稀释了真正需要收錄的 URL。
- 認為图片和 PDF 不用管:它們出問题时,占用的仍是同一份抓取资源。
- 把资源收錄当成頁面收錄来考核:两者的口径、展現位置都不同,混在一起統計會得到誤導性的结论。
回到站点运营的角度,非 HTML 资源的收錄更像是一次清理:哪些文件值得被找到,哪些只是過程产物。把不值得收錄的挡住,把值得收錄的配上文字說明和稳定地址,收錄資料的口径才會干净起来。