很多站点排查收錄問题时,第一反應是“蜘蛛没来”。但把日誌翻出来看,蜘蛛其實来過,甚至抓了好几遍,頁面依然停在“已抓取,未编入索引”。這时候問题往往不在抓取环节,而在頁面本身的质量判断上。
抓取和收錄是两道關
抓取解决的是“蜘蛛能不能拿到這個 URL 的内容”,收錄解决的是“拿到之後,值不值得放進索引、能不能參與检索”。前者看的是可訪問性、robots 規則、狀態碼、渲染方式;後者看的是内容本身有没有獨立價值,以及它在整個站点里是不是重复的。
所以同一個頁面可能在抓取侧完全正常——返回 200,正文能渲染,内鏈也能進来——却依然進不了索引。這不是蜘蛛没干活,而是在收錄這一步被過滤掉了。
哪些因素會影响“頁面质量”的判断
正文占比
把頁面 HTML 拉出来,去掉導航、頁脚、侧栏、广告位、推荐位之後,還剩下多少真正属于這個頁面的内容?如果正文只有两三行,其余全是模板和連結,這種頁面在质量判断里通常不占優势。常见于商品無描述頁、空标簽頁、只放了几句话的资讯頁。
模板重复度
批量生成的頁面,正文換几個词,模板一模一样,很容易被归到相似内容里。這里要区分两種重复:一種是同一個頁面被多個 URL 訪問,靠 canonical 解决;另一種是多個頁面内容高度相似,要靠合並或收敛解决。後者不是 canonical 能修的。
内容能否回答一個具体問题
判断标准可以很朴素:這個頁面對一個真實用戶有没有用。如果它只能靠站内其他頁面拼凑信息,或者只是關鍵詞的排列组合,那它在索引里也很难有位置。
自查顺序
- 先確認頁面能被抓取:狀態碼 200,没有被 robots.txt 挡住,没有 noindex。
- 看渲染後的 HTML 里有没有正文,而不是只看源碼里的占位符。
- 把模板元素去掉,估算正文的實际字數與信息密度。
- 和站内同類頁面做對比,看是否存在大段雷同。
- 確認這個頁面有没有獨立入口,還是只能從某個列表深處点到。
几個常见誤区
- 把“提交了 sitemap”当成“會被收錄”。sitemap 只解决發現和抓取提示,不解决质量判断。
- 以為加長字數就能過。凑字數带来的低质内容,和短内容一样难處理。
- 看到“已抓取未编入索引”就反复提交。重复提交不會改變頁面本身的判断结果,先把内容改到位再说。
- 把模板頁和正文頁混在一起评估。两者應该分開看,模板頁本来就不该期待收錄。
處理思路
對確認低质的頁面,優先做的是收敛,而不是硬推。能合並的合並,能补充的补充;既没有獨立價值又不打算维護的,让它登出索引往往比留在索引里更省事。站点整体质量提升之後,新頁面的收錄表現通常也會更稳定一些。
頁面质量不是一個開關,而是相對的:同一篇内容,放在一個整体质量較高的站上,和放在一個由大量模板頁支撑的站上,後面的结果可能完全不同。
最後提醒一句,收錄受很多因素影响,包括站点整体情况、竞争程度和搜尋需求,没有人能保證某個頁面一定進入索引。能做的只是把可控的部分——可抓取、可讀、有獨立價值——做到位。