做收录相关的工作,很多人第一反应是看索引量、看抓取频次,但更靠前的一步常被忽略:蜘蛛得先知道这个 URL 存在。发现不了,后面的抓取和收录都无从谈起。这篇讲的是 URL 发现路径,也就是蜘蛛是怎么在你的站里「走到」某个页面的。
发现、抓取、收录是三件事
发现(Discovery)指蜘蛛从某个已知地址里读到了一条新的链接;抓取(Crawl)指它真的去请求了这个地址;收录(Indexing)指抓取回来的内容经过处理进入了索引。三者是串联的,任何一环断掉,页面都不会出现在索引结果里。
所以当页面迟迟没有被收录时,先别急着改正文。可以先问一个问题:这个 URL,除了你手动提交,还有别的入口能通向它吗?
蜘蛛常用的几条发现路径
- 站内链接:最主要的来源,蜘蛛沿着 a 标签的 href 一路走。
- 站点地图:一份补充清单,适合新页面、孤立页面。
- 外部链接:其他站点的链接,尤其是首页或高权重页面上的。
- 提交与推送:搜索资源平台的手动提交、API 推送等。
几条路径里,站内链接是日常最可控的一条。站点地图和提交更像是「点名」,能加快发现,但不解决页面本身值不值得抓的问题。
内链深度:从首页点几次能到
可以把整站想象成一张图,首页是起点,链接是边。一个 URL 离首页越远,被发现的概率和频率通常越低。
常见的三种「藏得太深」
- 只能通过列表页翻到很后面才看得到,而前面的分页又是 JS 加载。
- 入口只存在于某篇旧文章的正文里,而那篇旧文章本身没被收录。
- 栏目页只展示最新一批内容,历史页面没有任何其他入口。
可以拿几个目标 URL 反过来查:站内还有哪些页面链到它?入口数量太少,或者入口本身等级太低,就需要补内链。
链接写法的几个坑
- 用 onclick 跳转或 div 冒充链接,没有 href,蜘蛛读不到地址。
- href 是 javascript:void(0) 或 # 占位,真实地址靠 JS 拼接,往往要等渲染才能拿到。
- 内链上随手加 rel="nofollow",这条路对蜘蛛就无效了。
- 同一个目标指向多个不同 URL(带参数、大小写差异),把入口权重拆散了。
内链不是越多越好。一个页面被几百个不相关的链接指向,和它被几个相关页面自然地推荐,效果完全不同。
站点地图是补充,不是替代
常见误解是「把 URL 都写进 sitemap 就一定会被收录」。站点地图的作用是告诉蜘蛛这里有这些地址,它不会替页面争取抓取预算,也不能改变页面质量的判断。把站点地图当作兜底手段,同时把内链做扎实,才是合理的搭配。
一个简单的自查流程
- 挑出最近想被收录、但状态不理想的 URL。
- 用站内搜索或抓取工具,查这些 URL 有多少内链入口。
- 检查入口链接是否为可抓取的 a href,是否被 nofollow 或 robots 阻断。
- 确认从首页到该 URL 需要点击几次,层级是否过深。
- 按需补入口:相关文章推荐、栏目列表、专题聚合页。
- 过一两周再观察抓取与索引状态的变化,不要当天就下结论。
小结
收录问题的排查顺序,建议从「能不能被发现」开始,再到「蜘蛛愿不愿意抓」,最后才是「内容质量够不够」。内链结构是这条链条里最容易控制、也最容易被忽略的一环。把入口理顺,不少页面的收录情况会跟着松动。