查收錄的时候,经常會看到一些意料之外的地址:上传目錄里的图片、放在根目錄的 PDF、附件下载頁、缩略图预览頁、用戶上传的文件列表。這些頁面本身没有多少可讀文本,也没有對應的搜尋需求,却實實在在進了索引。
它們不是错誤,但如果數量多、又長期没有價值,會占用抓取资源,也會让站点在索引里的整体构成變得模糊。要不要處理、怎么處理,先別一概而论。
先看它有没有可讀内容和明确任務
判断一個非正文頁面值不值得留在索引里,可以從两個問题入手。
- 用戶打開它,能不能得到完整答案?比如图片頁只有一張图和一串文件名,PDF 打開就是下载,那它更像资源的容器,不是頁面。
- 有没有人真的會搜尋它?协议文档、說明书、公開报告的 PDF,本身就是搜尋目标,這類不僅该留,還值得给标题、给描述、给上下文。
反過来,纯缩略图、纯附件下载、被系統自動生成的预览地址,通常两項都不满足。
常见的三類附属頁面
图片與媒体文件
图片單獨成一個 HTML 頁面,且頁面上没有說明文字、没有所属内容入口,這類頁面很难被当成獨立答案。它更适合作為上級内容頁的一部分存在。若确實需要獨立展示,就给它标题、說明、来源連結,让它變成一個可讀頁面。
PDF 和文档附件
附件的問题不在于格式,而在于有没有替代頁面。如果一份 PDF 的内容,站内已经有對應正文頁,两邊又都在索引里,就容易形成内容近似。此时常见做法是把正文頁作為主要版本,附件只作為下载入口,不單獨作為收錄目标。
系統生成的列表頁與预览頁
标簽、搜尋结果、用戶中心、临时预览這類地址,往往由參數组合生成。它們的數量可以無限扩張,内容重复度高,也很难有稳定搜尋需求。處理重点通常不是單個頁面,而是收敛入口,让蜘蛛不再持續發現新的组合。
處理顺序:先收入口,再谈标记
- 先看入口數量。一個頁面如果被站内几百個位置連結指向,無论你加什么标记,蜘蛛都會频繁来。先把不必要的入口收敛掉,效果比加标记更直接。
- 再定保留還是排除。有内容、有需求、有獨立價值的保留並补全信息;没有的走排除路线。
- 按需要選擇工具。不想让蜘蛛浪費抓取,用 robots.txt 拦抓取;希望蜘蛛能進来但不要進索引,用 noindex。两者管的不是同一段,用错會互相抵消。
- 最後看索引怎么退。已经被收錄的頁面,标记生效後需要一段時間才會從索引里登出,中間可能仍會展示舊版本,這属于正常過程,不必反复改動。
判断标准可以简化成一句话:這個地址單獨拿出来,是否值得成為一條獨立的搜尋结果。答案是否定的,它就不该是收錄目标。
上线前可以過一遍的清單
- 上传目錄、附件目錄是否可以被直接遍歷訪問
- 图片是否同时存在獨立頁和内容頁两種形態
- PDF 是否有對應的正文頁承担主要版本
- 预览、下载、临时地址是否带參數且被大量連結
- 站内搜尋和篩選结果是否對外開放抓取
非正文頁面本身不是問题,問题在于它們堆积之後,會让站点在索引里的画像變得含糊。定期清理一遍,比一次大規模整理更省力。