蜘蛛发现 URL 的主要途径是链接。同一批链接里,先抓到谁、后抓到谁,除了受抓取预算影响,也和链接本身的呈现方式有关:锚文本写了什么、链接放在页面哪个位置、周围文字是否与目标页主题一致,都会成为判断这个 URL 值不值得优先访问的参考。
锚文本与上下文提供的是判断依据
搜索蜘蛛看到的不是一个裸 URL。它会记录链接的锚文本、链接所在区块的标题、同段落的其他文字,以及链接在 DOM 中的位置。这些信息汇总起来,用于判断目标页的主题、与当前页的关系,以及是否需要尽快抓取。描述越清楚,判断成本越低;描述越模糊,蜘蛛只能依赖其他入口或 Sitemap 来补足。
常见的三类锚文本问题
- 空锚文本或纯图标链接:导航按钮只用图标、图片链接没有 alt 与 title,蜘蛛能发现 URL,但难以判断主题。
- 通用词锚文本:“点击这里”“了解更多”“详情”大量重复,无法区分不同目标页,同类页面容易在抓取队列中互相竞争。
- 锚文本与目标页主题不符:锚文本写着“教程”,落地页却是产品页,或反过来。目标页首屏内容与链接语义偏差过大时,这个入口的可信度会下降。
链接位置影响发现顺序
同一页面上,不同位置的链接被处理的先后通常不同。经验顺序大致是:主导航与面包屑、正文首屏内链、正文中后段内链、侧栏与页脚。这不是绝对规则,但如果重要栏目只出现在页脚,等于把它放在了发现链路的末端。
按位置做入口分层
- 核心栏目:放进主导航或面包屑,保证每个页面都能稳定触达。
- 重要内容:在正文首屏自然出现一次,并配具体锚文本。
- 批量页面:通过列表页、标签页、聚合页串联,不要在页脚堆几百条链接。
- 页脚链接:留给合规、帮助类页面,不承担主要发现职责。
逐条核对清单
- 抓取日志里,重要目录的首次抓取时间是否明显晚于导航目录。
- 核心页面除 Sitemap 外,是否存在至少一条来自正文或导航的入链。
- 同一目标页的锚文本是否过于分散,或全部是通用词。
- 图片链接是否有可被解析的文字描述,而不是只有 src 属性。
- JS 渲染出来的链接,在原始 HTML 中是否完全缺失。
- 内链指向的 URL 是否与 canonical、Sitemap 中的写法一致。
用日志验证,别靠感觉调整
改完锚文本与内链位置后,不宜只看一两天。以周为单位观察服务器日志中目标目录的抓取次数、首次抓取时间、状态码分布,再与调整前对比。如果抓取次数没有变化,说明入口链路本身不是瓶颈,问题可能在响应速度、页面体积或 robots 规则上。
锚文本与内链位置解决的是“蜘蛛能不能看懂、能不能先看到”的问题,它不承诺收录,也不承诺排名,只是把被发现和被正确理解的概率抬高一点。