很多站長把“蜘蛛来過”当成“收錄成功”,日誌里看到 200 狀態碼就安心了。但從抓取到進入索引之間,還有一道篩選:搜尋引擎需要判断這個頁面值不值得占用索引空間、值不值得在结果里占一個位置。這一步通常不會有明确通知,只能從頁面本身和站点整体狀態去推断。
抓取解决的是“能不能拿到”,收錄解决的是“值不值得留”
抓取是技術层面的動作:蜘蛛顺着連結過来,把 HTML 拿回去。收錄更接近一层篩選判断:這份内容相對已有内容有没有增量,頁面能否稳定訪問,主体内容能否被识別。两者用的不是同一套标准,所以會出現抓得到、進不去的情况。
理解這一点之後,很多“為什么没收錄”的問题會變得具体:不是蜘蛛找不到,而是找到之後没有通過篩選。
索引選頁时通常會關注的几個点
- 主体内容是否明确:正文能被提取出来,而不是被導航、推荐位、广告和评论区层层包住。
- 是否與站内其他頁面高度重合:同一篇文章出現在多個栏目、多個标簽下,算法需要挑出一個代表版本。
- 頁面是否提供獨立信息:篩選组合頁、自動聚合頁、只有一两段话的占位頁,往往属于“存在但没必要”。
- 站点整体质量:一個站点里如果堆了大量低质頁面,同類頁面的收錄概率會一起被拉低。
- 可訪問性與稳定性:频繁超时、間歇性返回 5xx、内容随刷新變化,都會让頁面难以稳定進入索引。
容易被挡在门外的几種頁面
薄内容頁
标题很長、正文只有两三句,其余全是模板文案。這類頁面單獨看不算错,但放在索引里没有可比較的價值,往往長期停留在已發現狀態。
自動生成頁
由規則批量拼出来的頁面,比如城市加關鍵詞、标簽组合、站内搜尋结果的落地地址。它們數量大、彼此相似,通常只有极少數會被收錄,其余會持續消耗抓取机會。
内容雷同頁
同一篇内容有 PC 版、移動版、打印版、被轉载版等多個地址。如果没有明确的規范地址指向,索引里要么反复替換,要么干脆都不稳定。
自查顺序
- 先確認頁面返回 200,且正文确實在初始 HTML 里,而不是靠脚本後补。
- 換几個入口訪問,確認 URL 唯一,參數、大小寫、结尾斜杠的處理一致。
- 看站内有没有別的頁面承载相同内容,確認哪個應该是主版本。
- 检查正文区是否被模板内容稀释,必要时調整頁面结构。
- 最後判断這個頁面本身值不值得單獨存在。如果答案是否定的,不必硬推。
站点层面能做的收敛
比起逐頁去催收錄,不如從源头减少低质頁面的产生:把自動聚合、篩選组合、分頁序列控制在合理范围;给真正有獨立價值的頁面更清晰的内鏈入口;對同一主题的多個版本指定規范地址;對没有長期價值的頁面及时清理或设為不可索引。
這样做的直接效果是让索引里留下的頁面更整齐,間接也會影响新頁面的進入速度——索引空間和抓取机會都是有限资源,用在哪儿是有取舍的。
收錄不是提交之後的必然结果,而是頁面在内容、重复度和可訪問性上综合過關之後的产物。把注意力放回頁面本身,通常比反复研究提交渠道更有用。