很多站点把“收录了多少页”当成运营目标,但收录本身只是搜索索引里的一个状态。抓取是搜索引擎发现并请求 URL,收录是经过一轮判断后决定是否放进索引。抓取成功不等于收录,收录了也不一定马上有展现。把不该收的页面硬推进去,往往只会增加重复内容,让索引覆盖报告更难读。
先分清抓取和收录,再谈分类
抓取和收录经常被混在一起说。蜘蛛来了、服务器返回 200,只能说明这个 URL 被抓取过;至于它会不会进入索引,还要看页面质量、重复程度、是否有明确主题、是否值得被检索。sitemap、内链、外链主要解决“发现和抓取”,它们不能保证收录。所以,看到“已抓取,尚未编入索引”时,不要先怪提交方式,而要回到页面本身。
把站内页面分成三类
与其一个个查收录,不如先给 URL 分类。分类清楚了,哪些该提交、哪些该拒绝、哪些该改造,会直接浮出来。
第一类:该收的核心内容页
- 产品、服务、文章、帮助文档等有独立信息价值的页面。
- 分类页如果有独特描述和足够条目,也可以作为该收页面。
- 要求:正文可被抓取、URL 稳定、标题和描述清晰、站内有正常入口。
这类页面如果迟迟没被收录,优先查内链入口、服务器响应、正文是否在 HTML 里、是否被 robots 或 noindex 误挡。
第二类:可不收的辅助页
- 分页列表第 2 页之后、标签聚合、站内搜索结果页。
- 排序、筛选、会话 ID 等参数生成的副本。
- 如果它们没有独立内容,通常不值得占用索引名额。
处理方式不是一刀切。确实有搜索需求的筛选页,可以精选少量保留;纯辅助页则用 noindex 或 robots.txt 收口。注意,robots.txt 挡的是抓取,noindex 挡的是收录,两者不要混着用。
第三类:不该收的低价值页
- 空列表、测试页、重复参数页、打印页、临时活动页。
- 同一内容仅 URL 不同的多个版本。
- 已经下架但仍返回 200 的空壳页。
这类页面该 404 就 404,该 410 就 410;同一内容多 URL 时,先确定主 URL,再做 301 或 canonical。URL 规范是分类的前提,否则索引里会出现多个版本,后续很难判断谁在参与排序。
分类之后,再看页面质量
页面质量不是一个可以套公式的分数。搜索引擎会看内容是否满足搜索需求、是否原创或经过有效聚合、主题是否集中、正文是否容易获取。若正文靠 JavaScript 渲染,先确认抓取到的 HTML 里有没有实际内容。若页面只是把别处的内容拼在一起,就算被收录,也很难稳定展现。
用跟踪表验证分类结果
分类不是一次性动作,可以用一张表持续跟踪:
- 选一批代表 URL,覆盖三类页面。
- 记录发现、抓取、索引三个状态,以及最近一次抓取时间。
- 每周看变化,重点不是收录总数,而是“该收未收”和“不该收却收了”。
- 对该收未收的页面,查内链、响应码、正文可抓取性和重复度。
- 对不该收却仍在索引里的页面,查是否还有入口、是否返回 200、是否被其他页面引用。
收录是结果,不是目标。先保证该收的能收,不该收的别放进去。
如果页面分类清楚,sitemap 和索引覆盖报告才有判断价值。否则,你只是把“没收录”的问题换成了“收了一堆没用页面”的问题。下一步,从站点结构里挑出十个代表 URL,先给它们贴上该收、可不收、不该收的标签,再决定提交、改造还是收口。