索引里出現一批正文很少甚至没有正文的頁面,是站点运营里比較常见的情况。這類頁面被收錄本身不算错誤,但如果它們占用抓取、稀释站内信号,或者让用戶点進来看到空白,就值得處理。處理之前不要直接批量 noindex,先把類型分清楚,否則容易把本来有潜力的頁面一起压掉。
先分清四種“薄”
空壳頁:模板在,正文不在
頁面能正常打開,導航、頁脚、推荐位都在,但主内容区是空的,或者只剩一句“暂無内容”。常见于篩選後無结果的列表頁、下架商品的詳情頁、被清空的内容頁。這類頁面返回 200,抓取端看到的是模板,索引里可能只留下标题和片段。
软 404:狀態碼是 200,内容却像不存在
典型的软 404 是“抱歉,未找到”頁面返回 200。對搜尋引擎来说,200 意味着這個 URL 是有效頁面,于是它可能被索引。软 404 與空壳頁的区別在于语义:一個明确表示對象不存在,一個只是暂时没渲染出内容。两者處理方式不同,软 404 更适合改成 404 或 410,空壳頁往往應该补内容或收口。
内容少但有效
词條释义、短新闻、公告、政策說明這類頁面本身字數不多,但信息完整、有獨立價值。判断标准不是字數,而是這個 URL 是否回答了某個具体問题、是否會被用戶主動需要。把它当薄内容删掉,往往得不偿失。
渲染後才出現的正文
前端框架項目里,原始 HTML 常常只有一個容器,正文由 JS 注入。抓取端如果只拿到原始响應,看到的就接近空壳。這種情况下要区分“頁面确實没内容”和“内容需要渲染才可见”,两者的修复路径完全不同。
動手前的几個检查動作
- 看原始 HTML:用 curl 或查看源代碼,而不是用開發者工具里的 Elements 面板。Elements 顯示的是渲染後的 DOM,會掩盖原始响應為空的事實。
- 對比同模板頁面:同一種模板下,正常頁面與可疑頁面的正文文本量差多少。如果绝大多數都只有几十個字,問题在模板或資料源,不在單個 URL。
- 確認索引狀態:在索引报告里看這個 URL 是被索引、被排除,還是已抓取但尚未编入索引。狀態不同,說明卡住的位置不同,處理動作也不同。
- 查連結来源:這些 URL 是從哪里被發現的。如果是站内篩選、分頁或排序组合大量生成,根的解法是控制 URL 生成規則,而不是逐個處理。
按類型决定處理顺序
- 先修模板和資料源。如果空壳是資料缺失造成的,补資料比加标簽更根本。
- 能合並的合並。多個薄頁面讲的是同一件事,就把它們並到一個主頁面,其余做 301,把信号集中起来。
- 确實没有存在必要的頁面,用 404 或 410。已经從站点移除的内容,保留 200 空壳只會繼續被当作有效 URL。
- 需要保留 URL 但不想被索引的,再考虑 noindex。noindex 是允许抓取但不索引,與 robots.txt 屏蔽不是一回事。
- 改完之後留观察期,看索引狀態是否變化。索引更新本身有延迟,短時間内反复改動作反而不好判断效果。
判断一個頁面该不该收口,先問两個問题:它對用戶有没有獨立價值,它的 URL 是否必须繼續存在。两個都否,處理動作才清楚。
容易踩的几個坑
- 把 noindex 和 canonical 混着用:canonical 是建议選我做主版本,不是排除指令;對一個頁面同时寫 noindex 和指向別處的 canonical,信号會互相干扰。
- 直接删掉有外鏈的舊頁面:如果舊 URL 有外部連結或歷史流量,先看能不能把内容合並到新頁面並做跳轉,而不是直接 410。
- 只看收錄數量,不看頁面构成:收錄數下降不一定是坏事,如果减掉的是空壳和软 404,索引质量反而更干净。
- 把内容少直接等同低质量:短頁面只要有獨特信息,依然可以被索引和展現,不需要因為是短就删。
薄内容和空壳頁的處理,本质上是一次對頁面價值的重新確認。先分類型,再定動作,最後看索引狀態變化,這個顺序比批量套用标簽更稳。