很多站点把“收錄了多少頁”当成运营目标,但收錄本身只是搜尋索引里的一個狀態。抓取是搜尋引擎發現並請求 URL,收錄是经過一轮判断後决定是否放進索引。抓取成功不等于收錄,收錄了也不一定马上有展現。把不该收的頁面硬推進去,往往只會增加重复内容,让索引覆盖报告更难讀。
先分清抓取和收錄,再谈分類
抓取和收錄经常被混在一起说。蜘蛛来了、服務器返回 200,只能說明這個 URL 被抓取過;至于它會不會進入索引,還要看頁面质量、重复程度、是否有明确主题、是否值得被检索。sitemap、内鏈、外鏈主要解决“發現和抓取”,它們不能保證收錄。所以,看到“已抓取,尚未编入索引”时,不要先怪提交方式,而要回到頁面本身。
把站内頁面分成三類
與其一個個查收錄,不如先给 URL 分類。分類清楚了,哪些该提交、哪些该拒绝、哪些该改造,會直接浮出来。
第一類:该收的核心内容頁
- 产品、服務、文章、帮助文档等有獨立信息價值的頁面。
- 分類頁如果有獨特描述和足够條目,也可以作為该收頁面。
- 要求:正文可被抓取、URL 稳定、标题和描述清晰、站内有正常入口。
這類頁面如果迟迟没被收錄,優先查内鏈入口、服務器响應、正文是否在 HTML 里、是否被 robots 或 noindex 誤挡。
第二類:可不收的辅助頁
- 分頁列表第 2 頁之後、标簽聚合、站内搜尋结果頁。
- 排序、篩選、會话 ID 等參數生成的副本。
- 如果它們没有獨立内容,通常不值得占用索引名額。
處理方式不是一刀切。确實有搜尋需求的篩選頁,可以精選少量保留;纯辅助頁則用 noindex 或 robots.txt 收口。注意,robots.txt 挡的是抓取,noindex 挡的是收錄,两者不要混着用。
第三類:不该收的低價值頁
- 空列表、測試頁、重复參數頁、打印頁、临时活動頁。
- 同一内容僅 URL 不同的多個版本。
- 已经下架但仍返回 200 的空壳頁。
這類頁面该 404 就 404,该 410 就 410;同一内容多 URL 时,先确定主 URL,再做 301 或 canonical。URL 規范是分類的前提,否則索引里會出現多個版本,後續很难判断谁在參與排序。
分類之後,再看頁面质量
頁面质量不是一個可以套公式的分數。搜尋引擎會看内容是否满足搜尋需求、是否原创或经過有效聚合、主题是否集中、正文是否容易获取。若正文靠 JavaScript 渲染,先確認抓取到的 HTML 里有没有實际内容。若頁面只是把別處的内容拼在一起,就算被收錄,也很难稳定展現。
用跟踪表驗證分類结果
分類不是一次性動作,可以用一張表持續跟踪:
- 選一批代表 URL,覆盖三類頁面。
- 记錄發現、抓取、索引三個狀態,以及最近一次抓取時間。
- 每周看變化,重点不是收錄總數,而是“该收未收”和“不该收却收了”。
- 對该收未收的頁面,查内鏈、响應碼、正文可抓取性和重复度。
- 對不该收却仍在索引里的頁面,查是否還有入口、是否返回 200、是否被其他頁面引用。
收錄是结果,不是目标。先保證该收的能收,不该收的別放進去。
如果頁面分類清楚,sitemap 和索引覆盖报告才有判断價值。否則,你只是把“没收錄”的問题換成了“收了一堆没用頁面”的問题。下一步,從站点结构里挑出十個代表 URL,先给它們贴上该收、可不收、不该收的标簽,再决定提交、改造還是收口。