搜索抓取

链接上那几个字:蜘蛛怎么用锚文本理解一个 URL

内链的价值不只是把 URL 摆到蜘蛛面前。链接上那几行字,是蜘蛛在抓取目标页之前对这个地址的唯一描述。本文梳理空锚文本、图片链接、通用词和模板链接这几类常见问题,说明锚文本应该描述什么,以及不借助工具如何抽查站内链接的文字质量。

搜索抓取

链接上那几个字:蜘蛛怎么用锚文本理解一个 URL

内链的价值常被简化成“多放链接”,但蜘蛛从一条链接上其实拿到两样东西:一个 URL,和一段文字。URL 决定它去哪儿,文字决定它对那个地方的第一判断。链接的位置和数量影响蜘蛛走不走得到,锚文本影响的是它走到之后,先以为这是什么。

蜘蛛从一条链接上能读到什么

一个链接元素里,蜘蛛至少能提取三部分:目标地址、链接文字、以及链接所在段落的上下文。在目标页还没被抓取之前,锚文本是它对这个地址的唯一描述。这段描述会参与几件事:判断这个 URL 要不要进入抓取队列、初步理解目标页的主题、以及在多个来源指向同一地址时形成一个大致共识。

所以锚文本首先是给机器看的标注,其次才是给用户看的入口。

四种常见的锚文本缺失

  • 空锚文本。标签里只有地址、没有文字,比如纯图标按钮。蜘蛛拿到了 URL,但没有任何主题信息。
  • 图片链接。图片的 alt 文字会被当作链接文字使用,alt 空着,效果等同于空锚文本。
  • 通用词。整屏导航都写着“了解更多”“点击这里”“详情”,这些词在任何页面都成立,对理解目标页没有帮助。
  • 脚本拼接。文字由前端脚本渲染后才出现在页面上,原始 HTML 里对应位置是空的,抓取阶段读不到。

锚文本和目标页面要对得上

如果一批链接都指向同一个页面,文字最好能描述这个页面本身的内容,允许在几个近义表达之间自然浮动。常见的反面做法有两种:一种是把同一组词反复塞进每一条链接,看起来很统一,实际读起来很生硬;另一种是用和目标页无关的词去凑,比如目标页在讲开票流程,链接却写“立即咨询”——这是动作指令,不是描述,对 URL 发现几乎没有贡献。

一个判断方法

把链接文字单独摘出来,遮住周围内容,看它能不能让人猜到目标页在讲什么。能猜出来,说明这段文字有效;猜不出来,它就是装饰。

模板生成的链接怎么管

导航、页脚、面包屑、相关推荐这些位置通常由模板批量输出,锚文本重复度极高。页脚的一整套栏目链接会在全站每个页面重复出现一次。这本身不算问题,但要注意两点:

  1. 模板链接的文字应该是栏目名本身,而不是菜单编号、图标名或英文缩写。
  2. 同一批链接不要堆在太多位置。重复的链接加重复的文字,对蜘蛛的增量信息接近于零。

内链改造时容易漏掉的地方

  • 正文里的链接改了文字,导航却没同步,同一目标页出现两套完全不同的描述。
  • 列表页把标题截断成前几个字,语义不完整,读起来像乱码。
  • 上一页、下一页用箭头符号或单个标点,蜘蛛拿不到可用文字。
  • 标签页、筛选条件的链接文字全是数字或单个量词。

不借助工具怎么抽查

先选一个你希望被更多抓取的页面,用站内搜索或站点范围查询,看它被哪些页面链接到,再逐个点开那些来源页,看链接周围的文字怎么写。如果一半以上的链接写的是“点击查看”“详情”,说明这个地址在站内几乎没有文字描述,蜘蛛只能靠别的信号来判断它是什么。

锚文本不是关键词投放位。把同一组词反复塞进链接,和把链接一律写成“了解更多”,本质是同一个问题:文字没有真正描述目标页面。

小结

内链结构决定蜘蛛能不能走到目标页,锚文本决定它走到之后如何理解这个页面。前者改一次,路径就通了;后者需要日常维护——每加一条链接,顺手把那几个字写对,成本很低,收益却会持续累积。