内鏈的價值常被简化成“多放連結”,但蜘蛛從一條連結上其實拿到两样東西:一個 URL,和一段文字。URL 决定它去哪儿,文字决定它對那個地方的第一判断。連結的位置和數量影响蜘蛛走不走得到,锚文本影响的是它走到之後,先以為這是什么。
蜘蛛從一條連結上能讀到什么
一個連結元素里,蜘蛛至少能提取三部分:目标地址、連結文字、以及連結所在段落的上下文。在目标頁還没被抓取之前,锚文本是它對這個地址的唯一描述。這段描述會參與几件事:判断這個 URL 要不要進入抓取队列、初步理解目标頁的主题、以及在多個来源指向同一地址时形成一個大致共识。
所以锚文本首先是给机器看的标注,其次才是给用戶看的入口。
四種常见的锚文本缺失
- 空锚文本。标簽里只有地址、没有文字,比如纯图标按钮。蜘蛛拿到了 URL,但没有任何主题信息。
- 图片連結。图片的 alt 文字會被当作連結文字使用,alt 空着,效果等同于空锚文本。
- 通用词。整屏導航都寫着“了解更多”“点击這里”“詳情”,這些词在任何頁面都成立,對理解目标頁没有帮助。
- 脚本拼接。文字由前端脚本渲染後才出現在頁面上,原始 HTML 里對應位置是空的,抓取阶段讀不到。
锚文本和目标頁面要對得上
如果一批連結都指向同一個頁面,文字最好能描述這個頁面本身的内容,允许在几個近义表達之間自然浮動。常见的反面做法有两種:一種是把同一组词反复塞進每一條連結,看起来很统一,實际讀起来很生硬;另一種是用和目标頁無關的词去凑,比如目标頁在讲開票流程,連結却寫“立即咨询”——這是動作指令,不是描述,對 URL 發現几乎没有贡献。
一個判断方法
把連結文字單獨摘出来,遮住周围内容,看它能不能让人猜到目标頁在讲什么。能猜出来,說明這段文字有效;猜不出来,它就是装饰。
模板生成的連結怎么管
導航、頁脚、面包屑、相關推荐這些位置通常由模板批量輸出,锚文本重复度极高。頁脚的一整套栏目連結會在全站每個頁面重复出現一次。這本身不算問题,但要注意两点:
- 模板連結的文字應该是栏目名本身,而不是菜單编号、图标名或英文缩寫。
- 同一批連結不要堆在太多位置。重复的連結加重复的文字,對蜘蛛的增量信息接近于零。
内鏈改造时容易漏掉的地方
- 正文里的連結改了文字,導航却没同步,同一目标頁出現两套完全不同的描述。
- 列表頁把标题截断成前几個字,语义不完整,讀起来像乱碼。
- 上一頁、下一頁用箭头符号或單個标点,蜘蛛拿不到可用文字。
- 标簽頁、篩選條件的連結文字全是數字或單個量词。
不借助工具怎么抽查
先選一個你希望被更多抓取的頁面,用站内搜尋或站点范围查询,看它被哪些頁面連結到,再逐個点開那些来源頁,看連結周围的文字怎么寫。如果一半以上的連結寫的是“点击查看”“詳情”,說明這個地址在站内几乎没有文字描述,蜘蛛只能靠別的信号来判断它是什么。
锚文本不是關鍵詞投放位。把同一组词反复塞進連結,和把連結一律寫成“了解更多”,本质是同一個問题:文字没有真正描述目标頁面。
小结
内鏈结构决定蜘蛛能不能走到目标頁,锚文本决定它走到之後如何理解這個頁面。前者改一次,路径就通了;後者需要日常维護——每加一條連結,顺手把那几個字寫對,成本很低,收益却會持續累积。