新页面发布后迟迟没有出现在搜索结果里,很多人第一反应是内容不够好。内容质量当然重要,但更前面的问题是:搜索引擎有没有发现这个 URL。URL 发现、抓取、索引是三件事,顺序不能颠倒。发现是入口,抓取是读取,索引是建立可检索的记录。下面按这个顺序梳理,哪些环节可控,哪些只能等待。
URL 发现是收录的起点
搜索引擎不会主动猜测一个从未出现过的地址。它需要从已知页面、站点地图、外部链接或历史抓取记录里拿到 URL。如果新页面没有任何入口,只靠手动提交,发现效率会很不稳定。常见的发现路径有三类:站内链接、站点地图、站外引用。它们不是互相替代,而是互相补充。
内链:最稳定的发现路径
站内链接通常是搜索引擎发现新 URL 最稳定的方式。导航、栏目列表、面包屑、相关推荐、上一页下一页,都能把抓取程序带到新页面。这里要注意两点:链接必须是可抓取的 a href,而不是只写了点击事件的按钮;链接所在页面本身要能被抓取,否则入口等于不存在。
如果新页面只放在首页某个轮播图里,而且轮播依赖脚本切换,抓取端可能只看到第一张。更稳妥的做法是在列表页、归档页或专题页留下普通链接。
站点地图:补充,不是替代
站点地图适合集中提交新页面、深层页面和更新较频繁的页面。但它更像是告诉搜索引擎这里有这些 URL,并不保证一定会抓取和收录。如果页面没有任何内链,只放在站点地图里,抓取优先级通常不会高。
使用站点地图时,lastmod 尽量准确。把所有页面都标成刚刚更新,时间久了反而会让这个字段失去参考价值。
外部引用与分享链接
来自其他站点的链接可以让新 URL 更快进入发现队列。社交平台分享、行业目录、合作页面上的链接也有类似作用,但效果不稳定,也不应该作为唯一手段。外链能缩短发现时间,不代表一定能通过后续的质量判断。
发现之后,还要过抓取和索引两关
URL 被发现后,搜索引擎会安排抓取。抓取到的页面要经过内容解析、重复判断、质量评估,才可能进入索引。这里容易出现几个卡点:
- 页面返回 200,但正文几乎没有有效内容,接近空页面。
- 多个 URL 内容高度相似,规范标签没有指向主版本。
- URL 参数、大小写、末尾斜杠不统一,同一内容出现多个地址。
- 页面被 robots.txt 屏蔽抓取,或者被 noindex 阻止索引。
- 正文依赖脚本渲染,抓取端拿到的内容很少。
这些问题不一定导致完全不被收录,但会降低进入索引的概率,或者让页面进入“已发现但未抓取”“已抓取但未索引”等状态。
发布后的自查顺序
- 确认 URL 返回 200,并且没有误设 noindex。
- 检查 robots.txt 是否屏蔽了该目录或该 URL。
- 在站内给它至少一个普通链接入口,最好来自相关列表页或正文。
- 把 URL 加入站点地图,并保持 lastmod 真实。
- 检查 canonical 是否指向自己或正确的主版本。
- 确认正文在关闭脚本后仍可读到主要内容。
- 观察服务器日志里该 URL 是否出现抓取记录,再判断是否进入索引。
抓取与收录的区别要分清
日志里出现抓取,只说明搜索引擎来过,不代表已经收录。搜索结果里没有展示,也不一定等于没有索引,可能是可检索性不足或没有合适展现。排查时先把“发现、抓取、索引、展现”分开看,再决定是补入口、改内容还是处理重复。
收录没有绝对的时间表。能控制的是让 URL 更容易被发现、更容易被正确读取、更少出现重复和规范问题,剩下的交给搜索引擎的判断。