不少站長在索引报告里看到“已抓取——尚未编入索引”,第一反應是抓取出了問题:是不是抓得太慢,是不是入口不够,是不是该再提交一次站点地图。但很多时候,搜尋引擎已经把頁面完整讀了一遍,只是讀完之後判断這一頁不值得單獨放進索引。抓取解决的是“能不能拿到”,收錄解决的是“拿到之後要不要留”,两者之間隔着一道质量门槛。
先分清抓取成功和值得收錄
抓取是通道問题,收錄是决策問题。通道出問题,通常表現為頁面長時間停在“已發現”,或者整站抓取量一直上不去;决策出問题,則表現為抓取正常、頁面也确實被讀走了,狀態却停在“已抓取——尚未编入索引”,或者收錄進来几天又被移出去。
這两種情况的處理方式完全不同。如果连抓取都没理顺,就去大改内容、合並頁面,很可能白忙一场。所以看到收錄不理想的頁面,先回到索引报告確認它停在哪一层,再决定下一步做什么。
哪些頁面容易被判定為單薄
- 只有标题加一两句介绍的栏目頁、地区頁、分類頁;
- 靠參數组合生成、内容由模板拼接出来的组合頁;
- 只罗列标题連結、缺少正文支撑的列表頁;
- 與站内另一個頁面八成以上内容重合的近似頁;
- 结构已经搭好、正文還空着的占位頁。
判断时看三個角度
一是獨立信息量:把導航、頁脚、推荐位都去掉之後,這一頁還剩多少内容是它獨有的。二是差异度:和站内最接近的那個頁面相比,能不能说清它單獨存在的理由。三是需求匹配:用戶搜這類词,是想看到一段說明、一组資料,還是只想找個入口。三样里有两样站不住,這一頁就很难被單獨收錄。
按這個顺序處理
- 先抽样人工看。從“已抓取——尚未编入索引”里按模板類型各抽几條,判断是普遍問题還是個例。
- 能合並的合並。多個頁面讲的其實是同一件事,就收敛成一個地址,其余做 301 指向主頁面。
- 能补充的补充。有真實内容可加,比如資料、說明、常见問题,就补齐,让它值得獨立存在。
- 补不了的先设 noindex。不急着刪除,先用 noindex 让它登出索引,同时保留頁面观察一段時間。
- 改完再做一次小范围观察。別指望立刻變化,索引决策本身有延迟,分批處理、分批看结果更稳。
批量頁面不要一次動完
如果全站有几千上萬個同模板的薄頁面,一次全改會带来两個麻烦:一是分不清哪一步動作起了作用,二是萬一方向改错,回退成本很高。更稳妥的做法是按模板分组,先拿一组做试驗,观察两三周,確認方向没错再推到下一组。
几個常见的誤判
- 把它当成抓取問题。于是反复提交、加内鏈、更換 URL,頁面内容却没變,狀態自然也不會變。
- 只盯着字數。字數只是表象,真正被衡量的是這一頁能提供的獨立信息。
- 直接刪除頁面。刪除會带来 404 和連結断裂,除非確認無用,否則用 noindex 更可控。
- 改完立刻下结论。索引狀態更新有滞後,短則几天,長則數周。
收錄不是申請下来的结果,而是頁面质量達标之後自然出現的狀態。與其反复追問為什么没收,不如回头看看這一頁到底提供了什么。
把動作放回到頁面本身:精简重复、补齐内容、收敛地址,剩下的交给時間。抓取和收錄的差別,往往就体現在這一步上。