网站收录

sitemap 写得很全,收录却没跟上:先检查这份清单里混进了什么

站点地图提交量不少,收录却没起色,问题常常出在清单本身。本文先说明 sitemap 影响的是发现而非索引,再梳理参数页、跳转页、屏蔽页等常见混入情况,并给出抽样核对、lastmod 使用、日志观察与清单收敛的执行顺序。

网站收录

sitemap 写得很全,收录却没跟上:先检查这份清单里混进了什么

站点地图(sitemap)写得很全,收录却没跟上,是很多站长常遇到的困惑。先要明确一点:sitemap 是一份“候选清单”,它告诉搜索引擎这些 URL 存在、可以去看看,但不代表提交就会被抓取,更不代表被抓取就会被收录。把 sitemap 当成收录开关,往往会做出错误的动作,比如不断重复提交、无限扩充条数。

先分清 sitemap 能做什么、不能做什么

sitemap 的作用是补充发现路径,尤其适合内链较少、层级较深或新上线的页面。它能影响的是“发现”,不是“索引”。是否抓取,取决于抓取预算、URL 的重要性和服务器的响应情况;是否收录,还要看页面质量、是否重复、有没有独立价值。所以当收录没跟上时,第一步不是加大提交量,而是检查这份清单本身是否干净。

sitemap 里常见的四类“混进来”的 URL

  • 带追踪参数的地址:utm、会话 ID、来源标记等参数产生的 URL 和主地址内容完全相同,放进去只会制造重复。
  • 已经跳转的旧地址:站点改版或栏目调整后,旧 URL 如果还留在 sitemap 里,等于把抓取资源引向重定向链。
  • 被屏蔽或标记 noindex 的页面:robots.txt 屏蔽、meta noindex 的页面出现在 sitemap 中,是自相矛盾的信号。
  • 无独立价值的组合页:筛选、排序、分页参数的排列组合动辄成百上千,铺进去很容易稀释整份清单的质量。

数量、更新与 lastmod 的可靠性

sitemap 不是越长越好。单个文件有大小和条数上限,超了要拆分成索引文件,这一点多数工具会自动处理。真正容易出问题的是 lastmod:如果每次生成都统一刷新成当天日期,搜索引擎很快会判断这个字段没有参考价值,进而降低整份 sitemap 的可信度。比较稳妥的做法是只在页面内容真实发生变化时更新对应条目的时间,其余保持不动。

一份可执行的核对顺序

  1. 确认 sitemap 地址本身返回 200,格式正确,没有被 robots.txt 误屏蔽,并已在后台提交。
  2. 从 sitemap 中抽样几十条 URL,逐条查看状态码、canonical 指向和是否 noindex,判断清单与实际可索引页面是否一致。
  3. 对比后台里“已提交”与“已编入索引”的数量。两者本来就有差距,差距是否集中在某一类页面上,比绝对数字更有参考意义。
  4. 翻一段服务器日志,看 sitemap 中的 URL 是否被实际抓取。如果长期没有抓取记录,问题多半不在 sitemap 本身,而在站点整体抓取情况或页面质量。
  5. 把清单收敛到只保留规范、可索引、有独立内容的 URL,再观察一段时间的抓取和收录变化。

sitemap 之外还得配合的几件事

  • 内链:能被站内正常点击到达的页面,发现路径更稳定,不必完全依赖 sitemap。
  • canonical:sitemap 里放的应当是与 canonical 一致的规范地址,两者冲突会让信号变模糊。
  • 页面质量:抓取和收录最终看的还是页面本身。模板占比高、内容单薄的页面,进不进 sitemap 意义都不大。
  • 日志观察:把日志当成反馈渠道,而不是只盯着提交数量。
sitemap 的价值在于把该被发现的页面准确交出去,而不是把能写的 URL 都堆上去。清单越干净,参考价值越高。

如果你的站点收录一直跟不上,建议先做一次 sitemap 的减法:删掉参数页、跳转页和屏蔽页,核对 canonical,再配合内链与日志观察抓取情况。抓取与收录本来就是两件事,分开看,问题会清楚很多。