蜘蛛发现 URL,主要靠链接走
搜索引擎发现新 URL 的入口有好几个,sitemap、外部链接、提交接口都算,但日常最稳定、量最大的还是站内链接跳转。蜘蛛从一个已知页面出发,顺着页面上的链接往下走,能走到哪一层,取决于你在站内怎么连。
于是就有一个很实际的问题:同一个新页面,挂在首页推荐位,和埋在第五层分类的“更多”里,被发现的概率和时间差别不小。这不神秘,也不涉及什么特殊技巧,只是链接路径长短带来的自然结果。
点击深度是什么,为什么值得单独看
点击深度,指从站点入口页(通常是首页)出发,点到某个页面最少需要几次跳转。距离首页一跳的页面,和距离首页五跳的页面,在蜘蛛的抓取计划里通常不会排在同一个优先级。
常见的情况是:重要内容建得比较晚,或者改版时被挪进了深层目录,链接层级一下子变深,收录速度随之变慢。这时候很多人第一反应是内容质量问题,其实先看一眼点击深度更省事。
- 首页、主导航:1 跳以内
- 频道页、一级分类:2 跳左右
- 详情页:3 跳上下比较常见
- 翻页、筛选、“更多”里的页面:容易滑到 4 跳以上
不是说超过某个跳数就一定收不到,而是同样一批页面,浅的更容易被优先抓到。
孤岛页面:蜘蛛找不到,不等于你的页面没价值
所谓孤岛页面,指站内没有可爬链接指向它,或者只有一条藏在脚本、表单、搜索框里的路径。它可能存在于 sitemap 里,可能有外链,但在站内结构上是断开的。
孤岛页面的常见成因:
- 新页面上线后只在后台或 App 里露出,Web 版没有入口
- 列表页是无限滚动,链接由脚本动态插入,HTML 源码里看不到
- 该页面只出现在搜索框的结果里,没有被任何静态链接引用
- 改版时旧入口被删,新入口没补上
这类页面能不能被收录,很大程度取决于 sitemap 和外链带来的线索,站内帮不上什么忙。数量一多,收录就会显得零散、随机。
链接层级怎么铺,三层结构比较稳
导航与频道页是主干
主干链接要稳定、少变。主导航上的分类,指向的应该是长期存在的频道页,而不是临时活动页。主干清晰的站点,蜘蛛每次来访都能沿着同一套路径覆盖一遍,新内容挂在下面被带到的概率也高。
列表页与聚合页负责分发
列表页是内容页最自然的入口。要确认列表里的链接是普通的超链接、href 是真实地址,并且在源码里就能看到,而不是等脚本执行完才出现。分页也别只留“下一页”,第一页到后面几页的路径最好都能点到。
正文内链和相关推荐做补充
正文里自然提到同主题页面时加链接,比在页脚堆一大串“热门推荐”更有效。相关推荐控制在几个到十几个,选真正同主题的,别把整站内容都挂上去。
埋了链接还是没收,常见是这几个原因
- 链接由脚本渲染:源码里没有 href,抓取时可能拿不到
- 链接加了 nofollow 或被 robots.txt 挡住:路径断了
- 页面本身不该被收录:比如被 noindex,或内容与其他 URL 高度重复
- 内链数量失控:一页挂几百条链接,蜘蛛分不清哪个重要,实际传递的效果也被摊薄
- 链接指向的是重定向链:中间跳几次,容易被中途放弃
先分清是“找不到”还是“找到了不想收”,处理方式完全不同。前者改链接,后者看页面质量和信号。
自查:快速判断页面是不是孤岛
- 关掉脚本执行,看页面源码里是否存在指向该页的可点击链接
- 用站内搜索或抓取工具查这个 URL 的站内入链数量,为 0 或只有 1 条就要留意
- 看服务器日志里这个 URL 有没有被蜘蛛访问过;访问过但一直没收录,问题就转到页面质量上
- 检查是否被 robots.txt 拦截,是否有 noindex,canonical 是否指向别处
调整顺序:先接回主干,再看效果
- 把重要的深层页面,接一条从频道页或上级列表页直达的链接
- 新内容上线时同步准备好入口,别只发 sitemap 等
- 把脚本渲染的列表链接改成服务端可见的普通链接
- 清理页脚和侧栏里的无效堆砌,把链接位留给真正需要发现的内容
- 观察一段时间日志,看这些 URL 的抓取频次有没有变化,再判断下一步
内链的作用是让蜘蛛更容易走到,不是保证被收录。页面能否进索引,最终还要看内容本身、重复程度和站点整体质量。链接层级能解决的是“发现”这一段,后面的判断不归它管。