收錄問题常被归因于蜘蛛不来,但日誌顯示抓取正常时,問题往往在頁面本身。頁面质量不是抽象分數,而是搜尋系統判断這個 URL 是否值得單獨保留一個索引版本。核對时可以先看正文,再看頁面差异,最後看時間與更新信号。
一、先確認蜘蛛抓到的正文是否完整
在讨论质量之前,先確認抓取层面没有明顯障碍。對照抓取日誌、頁面源碼和缓存版本,看正文是否直接出現在 HTML 中,還是依赖 JavaScript 渲染、登入狀態或用戶交互才出現。如果抓到的只是導航、頁脚和版權信息,後面的质量判断就失去了基础。
- 正文在 HTML 源碼中是否可讀;
- 關键段落是否被 CSS 隐藏或放在折叠面板里;
- 是否被 robots.txt、meta robots 或 X-Robots-Tag 誤拦。
抓取到的正文不完整时,先修可訪問性,不要急着改 canonical 或加 noindex。
二、模板重复:多個 URL 共用一套骨架
列表頁、篩選頁、标簽頁和商品分類頁最容易出現這種情况。判断方法:從同一模板下抽取若干 URL,去掉導航、侧栏和頁脚,比較正文主体。如果差异只有标题和一两行列表,搜尋系統可能只保留其中一個版本,其余被当作重复内容處理。
- 同一模板下抽样 5 到 10 個 URL;
- 比較正文主体字數與獨有段落;
- 查看這些 URL 是否有獨立的搜尋需求。
處理方向可以分三種:有獨立需求的頁面保留,並补足獨有信息;没有獨立需求但需要用戶訪問的,合並到主列表或加 noindex;不要用 canonical 把内容明顯不同的頁面强行指向同一個 URL,那样容易让索引選擇與预期不一致。
三、正文薄弱:有内容但撑不起一個索引版本
薄弱不等于字數少。工具頁、短問答、參數頁可能很短但有明确用途。判断时看三点:是否回答了标题承诺的問题;是否比搜尋结果里已有内容多出信息;是否只是把關鍵詞重复几遍。如果三者都不满足,這個 URL 很难被單獨索引。
- 标题與正文是否一致;
- 是否有可驗證的資料、步骤或结论;
- 是否與站内其他頁面高度相似。
處理顺序上,先补獨有信息,再考虑合並到更完整的頁面。如果頁面只是為覆盖關鍵詞而建,删掉或合並通常比硬撑更合适。
四、内容陈舊:時間信号與頁面狀態
有些頁面质量不差,但長期未更新,索引可能保留舊版本,或降低抓取频率。核對时看頁面上的時間是否真實、更新後 URL 是否變化、舊版本是否被重定向或繼續保留。
- 更新時間與正文實际修改是否一致;
- 重要頁面更新後是否有内鏈入口;
- 過时頁面是保留、改版還是返回 410。
不要為了顯得新鲜而改時間戳。搜尋系統會综合頁面變化、外鏈和用戶行為判断。
五、核對顺序:先改可抓取,再谈质量
- 狀態碼與抓取正常;
- 正文可被抓到;
- 同模板頁面差异足够;
- 有獨立需求則保留,否則合並或收口;
- 更新後观察抓取频率與索引版本變化。
頁面质量與收錄之間没有一键開關。把模板重复、正文薄弱、内容陈舊分開處理,比笼统地優化质量更容易看到變化。