很多站点排查收錄問题,第一反應是技術层面:robots 寫错了、站点地图没提交、内鏈太少。這些确實會让 URL 根本不被發現,但還有一類情况更常见——蜘蛛来過,URL 也進了抓取队列,頁面就是迟迟不進索引。這时問题往往不在“能不能抓”,而在“抓到了之後,這算不算一份有價值的頁面”。
抓取和收錄,解决的是两個不同的問题
抓取回答的是:這份内容能不能拿到。它更多看 URL 是否可達、robots 是否放行、服務器响應是否稳定。索引回答的是:這份内容放進结果集里有没有意义。後者要看頁面是否獨立成篇、有没有足够的可用信息、跟站内其他頁面相比有没有存在的必要。
所以會出現這種狀態:日誌里蜘蛛訪問正常,返回 200,後台顯示“已抓取,尚未编入索引”,一挂就是几周。這不等于被拒绝,只是没通過质量门槛,或者還没排到處理队列里。
容易被判定為质量不足的几類頁面
内容量太小,或者没有獨立信息
几百字的頁面不一定會被拒,但如果整頁只复述了标题,或者是從別處搬来的通用描述,蜘蛛拿到的信息量跟一個空壳差不多。典型例子是商品頁只有名稱和價格、没有規格和說明;文章頁只有一段導语加一堆推荐位。這類頁面不是不能收,而是收了也提供不了額外價值。
同一批頁面高度相似
分頁、篩選结果、按标簽聚合的列表頁,内容主体往往是同一份模板,只有几行資料不同。站内相似度太高时,搜尋引擎會挑代表性的一份留下,其余的選擇不收。這不是惩罚,而是去重。真正需要關注的是:這些頁面里有没有用戶會直接搜到的獨立内容。
主要信息依赖交互才出現
内容放在折叠面板里、要点開标簽頁才顯示、列表靠滚動加载——對用戶来说只是多点一下,對抓取程序来说可能整块都拿不到。如果頁面的核心信息不在初始 HTML 里,蜘蛛看到的版本和用戶看到的版本就不是一回事,判断质量时自然會吃亏。
頁面本身可用性差
打開就彈窗遮住正文、移動端文字被挤成两行、正文里插满跳轉連結——這些体驗层面的問题不會直接導致不收錄,但會作為整体质量的一部分被計入。尤其是彈窗和插屏,覆盖在正文之上的内容對抓取判断没有帮助。
自查时可以從這几個点入手
- 把頁面源碼里的正文單獨提出来,看還剩多少有效字數;
- 用搜尋框搜頁面里的一句原话,看有没有大量同站相似结果;
- 關掉 JavaScript 再看一遍頁面,確認核心信息還在不在;
- 對比同類型的几個頁面,問一句:如果只留一個,留哪個。
该等一等,還是该動手改
刚上线几天到两三周的頁面,狀態停在“已抓取,尚未编入索引”属于正常范围,不需要马上動。可以先把精力放在持續产出新内容、把站内入口理顺上。
但如果一個頁面挂了一個多月還没動静,並且同一批上线的其他頁面都進了索引,那就說明這一份大概率是质量判断没過關。這时候补内容、补獨立信息、把關键資料挪到初始 HTML 里,比反复提交 URL 更有效。改完不需要天天手動推送,正常的内鏈和站点地图會让蜘蛛再来一次。
收錄是结果,不是操作。把頁面做得值得被收,比反复催促蜘蛛更接近問题本身。
需要提醒的是,质量判断没有公開的分數线,也没有哪一步操作能保證頁面一定進索引。能做的只是让頁面在可抓取、可理解、有獨立信息這几件事上尽量不出短板,剩下的交给時間。