很多站点运营會把抓取和收錄当成同一件事:日誌里有蜘蛛来過,就預設頁面已经進索引。實际流程里,抓取更接近“把货搬進仓库”,而收錄是“决定要不要上架”。上架之前,搜尋系統通常會對頁面做几道减法:把冗余的URL版本合並掉,把重复或高度相似的内容過滤掉,再判断這個頁面是否值得單獨占一個索引位。
理解了這几道减法,很多“抓取很勤、收錄不涨”的現象就有了解释。
抓取是進货,收錄是上架
抓取阶段關心的是“能不能拿到内容”,收錄阶段關心的是“這個頁面有没有存在的必要”。同一批URL被站内連結或蜘蛛池發現後,會進入抓取队列,但抓取结果只是原料,搜尋系統還要做去重、质量判断和索引選擇。因此抓取量上升而收錄量不變,往往不是蜘蛛没来,而是頁面在後續篩選里被减掉了。
第一道减法:多余的URL版本
同一份内容如果存在多個可訪問地址,索引机會就會被分散,系統倾向于只保留一個代表版本。常见情况包括:
- 带參數的列表頁:?page=1、?sort=、?ref= 等组合出大量變体;
- 带與不带 www、http 與 https 同时可訪問;
- 结尾带斜杠與不带斜杠各返回 200;
- 路径大小寫混用,各生成一個地址;
- sessionid、追踪參數跟着連結在站内到處传播。
處理思路是先做規范:能 301 的统一跳轉,必须保留的用 canonical 指向代表版本,無意义的參數在連結层面收敛。規范没做干净时,即使推更多URL進去,也只是让重复版本互相竞争。
第二道减法:重复與近似内容
這里的重复不只是一字不差的複製,還包括同一份内容被反复轉载、列表頁與詳情頁大面积雷同、分頁頁面只差几條标题、分站共用同一套正文模板。近似程度越高,頁面被單獨保留的概率越低。
可以自查几点:正文中真正獨有的部分占多少;模板文字、導航、推荐位是否占了大半;多個頁面之間是否只有标题里的城市或型号不同。如果答案是“确實差不多”,優先补充獨有信息,而不是繼續加URL。
第三道减法:頁面能不能自己站住
通過前两道减法後,頁面還要回答几個問题:它提供的信息,是否已经能由站内另一個頁面完整回答?内容能否满足從搜尋词進来的訪問者?頁面本身是否可正常渲染、正文可讀、没有把關键内容藏在交互之後?這些問题不解决,頁面就容易停留在“被抓過、但没被收錄”的狀態。
站点可以做的一份核對清單
- 按模板归類近30天抓取量高但未收錄的URL样本,而不是一個個單獨看;
- 检查這些URL是否與站内其他頁面高度相似,找出真正重复的那一類;
- 確認規范标簽、301跳轉、參數收敛落實在代碼层面,而不是只寫在文档里;
- 對内容做减法:删掉没有獨立價值的頁面,往往比逐個修补更省事;
- 保留有明确搜尋需求、有獨有信息的頁面,並让内部連結指向它們。
抓取是別人愿意来看,收錄是系統愿意留下。後者不靠提交量堆出来,而靠頁面本身经得起减法。
把這三道减法先做完,再谈蜘蛛池、URL發現和提交策略,效果才不會被重复内容抵消掉。