做收錄梳理时,很多站点會先定一條笼统的規則:字數太少、信息简單的頁面先排除在外。可真执行起来,联系方式頁、在线表單頁、單位換算工具頁、门店地址頁這類頁面,往往又是用戶從搜尋進来後真正要用的一頁。全部放開會让整站质量被稀释,一律排除也未必合理。關键是把“内容短”和“没有價值”分開看——它們是两件事。
先分清三種“短頁面”
同样是文字少,来源完全不同,處理方式也不该一样。
- 功能性頁面:在线表單、計算器、查询工具。主体是交互,文字只是說明,但用戶目的非常明确。
- 入口型頁面:联系方式、门店地址、服務范围、售後政策。信息量小,但通常包含別處没有的唯一事實。
- 拼接型頁面:标簽聚合、篩選结果、空列表頁。由模板加參數生成,換個參數内容几乎不變。
前两類是“短但有内容”,第三類多數是“長但没内容”——頁面结构看着完整,有效信息却接近于零。做判断时看的是有效信息,不是字數。
决定要不要收錄的三個判断点
1. 頁面上有没有獨立事實
电话号碼、营业時間、覆盖区域、價格区間、可用的參數组合,只要這些是真實且唯一的,頁面就有被單獨搜到的可能。反過来,如果整頁文字都能在別的頁面里找到,它大概率只是重复内容的一種呈現。
2. 用戶能不能直接從搜尋進入並使用
能直接用的頁面,值得让蜘蛛抓取;只能作為流程中一步存在的頁面,比如提交成功頁、支付中間頁、訂單確認頁,即使被抓到,也很难在搜尋结果里找到合适的位置。
3. 是否和已有頁面高度重叠
如果同一批信息已经有一個主頁面在承担收錄任務,再放開一堆近似頁面,容易把索引位置和權重分散開。這類頁面更适合保留给用戶走站内路径,不必都推给蜘蛛。
三種常见的處理方式
- 保留並完善:有獨立事實、有搜尋需求的頁面,补上必要說明、结构化信息和内鏈,让它成為正常的收錄頁面。
- 保留但降低收錄優先級:頁面本身對用戶有用,但内容單薄、需求分散。可以正常抓取,不必主動推送,也不必强求它出現在索引里。
- 不让收錄:拼接生成、無獨立信息的頁面,用 noindex 明确表態,比只依赖 robots.txt 更干净——robots.txt 挡的是抓取,已经進過索引的 URL 不會因為它自動消失。
抓取、收錄、展示是三件事
被蜘蛛抓到、被放進索引、能在搜尋里出現,是三個递進的阶段,任何一步都可能卡住。一個頁面文字很少,但信息唯一、结构清楚,照样可能被正常收錄;一個頁面寫得再長,如果全是模板拼接和重复段落,也可能一直停在“已發現”的狀態。判断薄頁面时,先看它属于哪一類,再决定是补内容、調结构,還是干脆不推。
比較實用的一條原則:如果這個頁面被用戶單獨搜到时有實际用處,就值得让蜘蛛抓;如果它只在站内流程里才有意义,就別指望它自己带来搜尋流量。
自查时可以先看這几点
- 這個 URL 有没有在 sitemap、内鏈里被反复推到蜘蛛面前?
- 頁面上的信息,在站内其他頁面能不能找到八成以上?
- 把它從索引里拿掉,用戶從搜尋進来时會不會找不到需要的入口?
- 如果决定不收錄,用的是 noindex,還是只靠 robots.txt?
這几個問题回答完,大多數關于“短頁面该不该收錄”的分歧,基本就能落地成具体動作了。