很多站長判断抓取是否正常时,只看蜘蛛有没有来。但抓取其實是两步:先請求,再判断這次請求值不值得繼續。有些頁面确實被蜘蛛抓到了,返回的也是 200,可它既没有内容,也没有可繼續跟随的連結,蜘蛛来過一次之後就很少再来。這類頁面通常被归為软 404 或空壳頁面,它們不报错,却在慢慢消耗站点的抓取资源。
什么是软 404 與空壳頁面
软 404 指的是頁面實际不存在或已失效,但服務器仍然返回 200 狀態碼,並在頁面上给出「内容不存在」「已下架」之類的提示。空壳頁面則更宽泛:狀態碼正常,但頁面主体只有模板、導航和占位文案,没有實质信息,也没有明确的下一步入口。两者共同的特点,是让蜘蛛無法從這次抓取中得到有效内容,也很难判断這個 URL 接下来還會不會有變化。
它們對抓取路径的三层影响
消耗抓取预算
蜘蛛在一段時間内能抓的頁面數量是有限的。大量空壳頁面占用了請求次數,真正需要更新的頁面就要排队等待。
打断内鏈路径
如果一個栏目頁或列表頁里,大量連結指向的都是空内容頁面,蜘蛛顺着這些連結繼續走的意愿會下降,新的有效 URL 也更难被连續發現。
影响站点整体判断
蜘蛛對站点的抓取投入,往往和它對站点的整体印象有關。空壳頁面比例偏高时,它可能倾向于降低抓取频率,這對新内容产出較多的站点尤其不利。
常见的产生场景
- 电商站点的無库存、已下架商品頁,舊 URL 仍然保留
- 篩選條件與站内搜尋组合出的無结果頁面
- 活動結束後没有下线的专题頁、报名頁
- 分頁參數越界,翻到超出范围的頁碼
- 需要登入或特定條件才能看到内容的頁面,蜘蛛訪問时只剩提示文案
- 聚合頁面在抓取資料失敗时,只剩下标题和空白区块
怎么排查
- 從服務器日誌中篩選返回 200 但頁面体积明顯偏小的 URL,先看它們集中在哪些目錄。
- 抽样打開這些地址,對比蜘蛛 UA 與普通浏览器的返回内容,確認是不是條件判断導致的空頁面。
- 把頁面按有内容、内容很少、完全没有内容三档分類,不要一上来就全站處理。
- 检查這些 URL 的内鏈来源,看看是哪個列表頁或模板在批量輸出它們。
處理时的顺序
處理的原則是按頁面真實狀態给出明确答案,而不是一律用同一種方式掩盖。
确實不存在的内容,應返回 404 或 410,並從列表頁和内鏈中移除入口,让它自然登出抓取队列。暂时没有内容但會恢复的頁面,可以保留地址,但不要在頁面上堆砌無關文案充數;必要时用 503 表達暂时不可用,同时注意不要長期使用。内容确實很薄的頁面,優先考虑合並到相關頁面,或者补充有效信息,而不是让它單獨占一個 URL。
篩選頁和分頁參數造成的空结果,更适合在參數层面收敛,避免生成大量無意义的组合地址,這比逐個頁面處理更省力。
別用抓取速度換内容质量
清理空壳頁面之後,短期看被抓取的 URL 數量可能下降,但留下来的地址更接近真實内容,蜘蛛後續對站点的抓取节奏通常更稳定。
需要提醒的是,不要為了清理空壳頁面就给整站加 noindex,也不要让正常栏目頁跟着一起被拦。清理的目标是让每個被抓取的地址都有明确含义,而不是單纯减少被抓取的數量。可以先選一個小范围目錄做驗證,观察一段時間内有效頁面的抓取變化,再决定是否扩大處理范围。
抓取這件事,蜘蛛愿意繼續顺着連結走下去,往往比單次抓到多少頁面更重要。软 404 和空壳頁面不會立刻造成明顯問题,但它們會让抓取路径越走越窄。定期检查返回 200 的薄内容頁面,把入口整理清楚,抓取资源才能落在真正需要被發現的 URL 上。