搜索抓取

锚文本与链接上下文:蜘蛛顺着链接走时,还读到了哪些信号

蜘蛛跟随链接时,拿到的不只是一个 URL。锚文本、链接周围的句子、链接所在的位置,都会影响它对目标页的初步判断。本文梳理蜘蛛能从站内链接里读到哪些信号、这些信号影响什么、又不影响什么,并列出锚文本与上下文常见的写法与误区。

搜索抓取

锚文本与链接上下文:蜘蛛顺着链接走时,还读到了哪些信号

蜘蛛从一个链接里读到什么

一个站内链接通常包含几层信息:链接指向的 URL、可见的锚文本、锚文本前后的句子、链接所在的区域(导航、正文、侧栏、页脚),以及 rel 等附加标记。URL 决定蜘蛛能不能打开这个地址,其余部分则影响它对“这个地址值不值得抓、大概讲什么”的判断。

很多人把注意力全放在 href 上,其实锚文本和上下文是蜘蛛理解一个陌生 URL 最廉价的线索。尤其是新页面刚上线、还没有外链和数据积累时,站内链接的文字描述往往是它唯一能参考的信息。

锚文本:蜘蛛判断目标页主题的捷径

“点击这里”“更多”“详情”这类锚文本,对用户勉强够用,对蜘蛛几乎等于没有信息。一段描述性的锚文本,比如“服务器日志里的抓取记录怎么看”,能让蜘蛛在还没打开页面时,就对内容方向有一个初步判断。

  • 锚文本与目标页主题一致,比堆砌关键词更有意义;
  • 同一个 URL 在站内被不同措辞链接,属于正常现象,不必强行统一;
  • 图片链接靠 alt 文本补充说明,缺了 alt 基本等于空链接。

锚文本不会直接决定抓取顺序

需要说清楚一点:锚文本主要影响的是相关性判断,而不是抓取队列的排序。它不会让某个 URL 因为锚文本写得漂亮就被优先抓取。指望靠改锚文本把蜘蛛“叫过来”,通常不会有效果。

链接周围的文字同样会被读到

如果锚文本本身很含糊,蜘蛛会退一步看它所在的那一段。列表项里的一句话、正文中带链接的整句、表格里相邻单元格的文字,都可能被当作上下文。这也是为什么“把链接放在有解释的句子里”比“把链接排成一列裸 URL”更好——至少对蜘蛛来说,信息量不一样。

如果一个链接离开上下文就无法被理解,那它对蜘蛛来说大概率也是低信息量的链接。

链接位置带来的差异

导航、正文、页脚里的链接,蜘蛛都会走,但走的节奏和重复次数不同。导航和页脚在很多页面重复出现,很容易被识别为模板部分,重复抓取的价值有限;正文里的链接通常是页面独有内容,被跟随的概率和频次相对更高。因此,重要页面最好在正文里也有自然提及,而不是只躺在页脚。

几个常见的做法与误区

  1. 不必给所有链接写长锚文本。正文里的自然引用比刻意加长的链接文字更合理。
  2. 别用同一个锚文本链向多个不同页面。这会让上下文信号变得模糊。
  3. 内链要指向真正相关的页面。为了增加链接数量而随意插入,收益很小。
  4. 定期检查空锚文本和图片链接的 alt。这是最容易被忽略的一类“无描述链接”。

小结

URL 发现靠的是链接本身,而链接的价值不止于 href。锚文本和上下文决定了蜘蛛在打开页面之前能获得多少信息,也影响它对页面主题的初步归类。把这部分写清楚,不需要额外成本,却能让内链结构更容易被理解。至于抓取和收录的结果,仍然取决于站点整体质量、服务器状态和蜘蛛自身的调度,没有哪一种锚文本写法能单独起到决定作用。