爬虫来過、日誌里留着 200,不等于頁面會被收錄。抓取只是把頁面取回去,收錄還要看搜尋引擎是否認為它值得作為一個獨立结果保留。正文太薄、模板和導航占了大半屏的頁面,最容易卡在“已抓取、未收錄”這一步。
先分清:抓到了和收不收是两件事
抓取是技術動作,收錄是價值判断。日誌里有訪問记錄,只說明 URL 被發現了、被取回了一次。至于這個頁面進不進索引,取决于它有没有獨立的信息增量、内容是否成篇、跟站内其他頁面是不是高度重合。把這两件事混在一起看,很容易得出“爬虫不爱来”的错誤结论,然後去改一些並不相關的配置。
什么样的頁面會被判定為“主体不清晰”
不需要专业工具,從用戶视角過一遍就能看出大概。下面几類頁面,通常很难拿到獨立的收錄位:
- 只有一句结论的頁面:标题加一段话,剩下的全是相關推荐、热门标簽和頁脚。
- 靠列表堆词的頁面:几十個關鍵詞串成一段,讀起来没有句子结构,看不出要回答什么問题。
- 拼接出来的頁面:正文由其他頁面的摘要拼起来,内容都能在別處找到,本身没有增量。
- 模板占比過高:首屏几乎全是導航、篩選、广告和运营位,正文被压到很靠下的位置。
- 同一模板的量产頁:除了标题里的地名或型号,正文段落几乎一字不差。
這些頁面的共同点不是“短”,而是看不出這個 URL 存在的理由。長度只是表象,主体是否成立才是關键。
自查:把模板去掉,再看剩下什么
與其纠结字數,不如做一次结构上的剥离,看看頁面在“只剩主体”时是什么样子:
- 暂时屏蔽全站導航、侧栏和頁脚,在浏览器里刷新,看正文還剩下多少。
- 把小标题和列表符号去掉,只讀段落,判断是不是還能形成连贯表達。
- 把頁面标题盖住,看正文里有没有一句话能說明它讲的是什么。
- 拿同模板的三個頁面做對比,找出除了名稱之外還有哪些内容不一样。
- 在站内搜一句正文里的原话,看有没有別的頁面出現過同样的表述。
做完這几步,頁面属于“主体偏薄”“主体缺失”還是“與其他頁高度重合”,基本就能定性了。定性之後再去决定改哪里,比笼统地“加点字數”有效得多。
核對之後的處理顺序
處理时建议按下面這個顺序推進,先判断價值,再决定動作:
- 先判断有没有獨立價值:這個 URL 是否解决了別處没解决的問题。有,就走补内容;没有,直接進入下一條。
- 补主体而不是补字數:补充用戶真正需要的信息,比如具体步骤、判断依據、常见誤区,而不是把一句话扩寫成三段同义句。
- 能合並就合並:同一主题下若干薄頁,合並成一個完整頁面,让舊 URL 指向新頁,避免多頁争一個需求。
- 确實没有價值就收敛:例如無内容的篩選结果頁、纯參數组合頁,用規范的指令让它不進索引,而不是放任它被反复抓取。
- 改動後按批次观察:一次只調整一類頁面,過一段時間回看抓取日誌與索引狀態,才能判断這次調整是否有效。
几個容易走偏的地方
- 為了凑長度硬加模板段落,只會让模板占比更高,問题反而更明顯。
- 把關鍵詞密度当成主体质量,堆词換不来收錄,還會影响可讀性。
- 只盯着收錄數量,忽略這些頁面被收錄後是否真的带来訪問,容易做無用功。
- 把“已抓取、未收錄”一律当成技術故障,忽略了頁面本身的問题。
收錄是頁面质量的结果,不是配置出来的狀態。先把頁面寫成值得被保留的样子,再去谈抓取和提交。
如果你手上正有一批長期停在“已抓取、未收錄”的 URL,可以先按模板把頁面分成几组,從最薄的一组開始做主体核對。改完一批再观察一批,比全站同时動刀更容易看清是哪一步起了作用。