在网站收录的讨论里,抓取和收录经常被混在一起说。抓取是爬虫把页面内容下载回去,收录是搜索引擎在下载之后,判断这个 URL 是否值得放进索引。页面能被抓取,只是拿到入场券;能不能被收录,还取决于页面本身的质量、重复程度、URL 规范以及站点整体信号。
当页面迟迟不收录,或者收录后又变得不稳定,先不要急着堆外链或反复提交。可以从页面质量和 URL 两个层面做一轮自查,看看问题出在“没被发现”还是“被发现但没通过质量判断”。
先分清:抓取、索引和排名不是同一件事
抓取看的是可达性:robots 是否允许、服务器是否稳定返回、入口是否足够。索引看的是评估结果:页面主体是否清晰、是否与已有内容高度重复、是否满足基本质量门槛。排名则更靠后,是在已收录页面中做相关性排序。三层混在一起判断,很容易把质量问题当成抓取问题处理。
页面质量自查:几个容易被忽略的信号
1. 模板化正文占比过高
列表页、聚合页、标签页常见这种情况:页头、导航、筛选条、推荐位、页脚占了大部分 HTML,真正属于该 URL 的内容只有一两句话。爬虫渲染后拿到的文本里,模板部分反复出现,主内容很薄。这样的页面即使被频繁抓取,也容易长期停留在“已抓取未索引”。
自查时可以把页面文本复制出来,删掉导航、页脚和推荐模块,看剩下的主体有多少是独有的。如果独有内容不足整页文本的两三成,收录动力通常偏弱。
2. 重复段落与近重复内容
同一套产品描述、同一段公司介绍、同一批 FAQ,被复制到几十个 URL 上,搜索引擎会先做聚类,再从中选择代表页。此时不是每个 URL 都会进入索引,很多会因为重复而被折叠。要处理的是:这些 URL 是否真的需要独立收录?如果不需要,用 canonical 或 robots 做取舍;如果需要,就要让每个页面有不可替代的信息。
3. 缺失主内容或首屏没有实质信息
有些页面返回 200,也有标题和描述,但正文区域是空的、只有一张图、或者内容依赖登录后才展示。对爬虫来说,这接近没有主内容。先确认服务端返回的 HTML 里有没有核心文本,再看 JavaScript 渲染后是否补全。若首屏和渲染后都没有实质内容,收录概率会明显下降。
4. 信息密度低,绕来绕去
为了“显得内容多”而拼接同义句、重复问答、堆砌不相关段落,对收录帮助有限。页面质量更看重能否快速回答用户问题:定义、步骤、条件、边界、示例。把同一件事说清楚,比写长但空洞更有效。
URL 规范:先统一入口,再谈收录
同一内容如果有多个 URL 入口,比如带不带 www、大小写不同、结尾斜杠不一致、参数顺序不同、跟踪参数产生新地址,索引信号会被分散。搜索引擎需要在多个 URL 之间选一个代表页,选择过程本身就会拉长收录时间,也可能让表现较好的版本被替换。
日常可以定期用站内爬取或日志抽查,把同一内容对应的 URL 收敛到一个规范形式。规范确定后,内链、站点地图、canonical 和跳转都指向同一个版本,减少反复切换。
一个可操作的检查顺序
- 确认可抓取:看 robots、返回码、服务器日志里是否有该 URL 的抓取记录。没有抓取记录时,先解决发现和入口问题。
- 查看索引状态:用站点查询指令或后台工具确认是“已收录”“已抓取未索引”还是“已发现未抓取”。不同状态对应不同动作。
- 提取页面主体:去掉模板后看独有内容有多少,判断是否属于薄内容或重复内容。
- 对比重复 URL:找出同一内容的其他入口,决定保留哪个、合并哪个、屏蔽哪个。
- 检查 URL 规范:协议、主机名、大小写、斜杠、参数是否统一,内链是否指向规范版本。
- 调整后观察:给搜索引擎重新抓取和评估的时间,观察日志、索引状态和代表页变化,不要一天内多次改动。
调整时容易走偏的地方
为了收录而临时填充大段无关文字,通常不会提升页面质量,反而可能让主体更模糊。
另外,频繁修改 canonical、反复提交站点地图、短时间内大量改标题和正文,都会让信号变得不稳定。更稳妥的做法是先把页面主体和 URL 规范整理清楚,再让爬虫按正常节奏重新抓取。
小结
抓取和收录之间隔着质量评估。页面不收录时,先确认爬虫是否拿到完整主体,再检查模板占比、重复段落、主内容缺失和 URL 规范。把这些基础项处理好,比反复提交或堆砌内容更接近问题的根源。