搜尋抓取

連結上那几個字:蜘蛛怎么用锚文本理解一個 URL

内鏈的價值不只是把 URL 摆到蜘蛛面前。連結上那几行字,是蜘蛛在抓取目标頁之前對這個地址的唯一描述。本文梳理空锚文本、图片連結、通用词和模板連結這几類常见問题,說明锚文本應该描述什么,以及不借助工具如何抽查站内連結的文字质量。

搜尋抓取

連結上那几個字:蜘蛛怎么用锚文本理解一個 URL

内鏈的價值常被简化成“多放連結”,但蜘蛛從一條連結上其實拿到两样東西:一個 URL,和一段文字。URL 决定它去哪儿,文字决定它對那個地方的第一判断。連結的位置和數量影响蜘蛛走不走得到,锚文本影响的是它走到之後,先以為這是什么。

蜘蛛從一條連結上能讀到什么

一個連結元素里,蜘蛛至少能提取三部分:目标地址、連結文字、以及連結所在段落的上下文。在目标頁還没被抓取之前,锚文本是它對這個地址的唯一描述。這段描述會參與几件事:判断這個 URL 要不要進入抓取队列、初步理解目标頁的主题、以及在多個来源指向同一地址时形成一個大致共识。

所以锚文本首先是给机器看的标注,其次才是给用戶看的入口。

四種常见的锚文本缺失

  • 空锚文本。标簽里只有地址、没有文字,比如纯图标按钮。蜘蛛拿到了 URL,但没有任何主题信息。
  • 图片連結。图片的 alt 文字會被当作連結文字使用,alt 空着,效果等同于空锚文本。
  • 通用词。整屏導航都寫着“了解更多”“点击這里”“詳情”,這些词在任何頁面都成立,對理解目标頁没有帮助。
  • 脚本拼接。文字由前端脚本渲染後才出現在頁面上,原始 HTML 里對應位置是空的,抓取阶段讀不到。

锚文本和目标頁面要對得上

如果一批連結都指向同一個頁面,文字最好能描述這個頁面本身的内容,允许在几個近义表達之間自然浮動。常见的反面做法有两種:一種是把同一组词反复塞進每一條連結,看起来很统一,實际讀起来很生硬;另一種是用和目标頁無關的词去凑,比如目标頁在讲開票流程,連結却寫“立即咨询”——這是動作指令,不是描述,對 URL 發現几乎没有贡献。

一個判断方法

把連結文字單獨摘出来,遮住周围内容,看它能不能让人猜到目标頁在讲什么。能猜出来,說明這段文字有效;猜不出来,它就是装饰。

模板生成的連結怎么管

導航、頁脚、面包屑、相關推荐這些位置通常由模板批量輸出,锚文本重复度极高。頁脚的一整套栏目連結會在全站每個頁面重复出現一次。這本身不算問题,但要注意两点:

  1. 模板連結的文字應该是栏目名本身,而不是菜單编号、图标名或英文缩寫。
  2. 同一批連結不要堆在太多位置。重复的連結加重复的文字,對蜘蛛的增量信息接近于零。

内鏈改造时容易漏掉的地方

  • 正文里的連結改了文字,導航却没同步,同一目标頁出現两套完全不同的描述。
  • 列表頁把标题截断成前几個字,语义不完整,讀起来像乱碼。
  • 上一頁、下一頁用箭头符号或單個标点,蜘蛛拿不到可用文字。
  • 标簽頁、篩選條件的連結文字全是數字或單個量词。

不借助工具怎么抽查

先選一個你希望被更多抓取的頁面,用站内搜尋或站点范围查询,看它被哪些頁面連結到,再逐個点開那些来源頁,看連結周围的文字怎么寫。如果一半以上的連結寫的是“点击查看”“詳情”,說明這個地址在站内几乎没有文字描述,蜘蛛只能靠別的信号来判断它是什么。

锚文本不是關鍵詞投放位。把同一组词反复塞進連結,和把連結一律寫成“了解更多”,本质是同一個問题:文字没有真正描述目标頁面。

小结

内鏈结构决定蜘蛛能不能走到目标頁,锚文本决定它走到之後如何理解這個頁面。前者改一次,路径就通了;後者需要日常维護——每加一條連結,顺手把那几個字寫對,成本很低,收益却會持續累积。