内链的价值常被简化成“多放链接”,但蜘蛛从一条链接上其实拿到两样东西:一个 URL,和一段文字。URL 决定它去哪儿,文字决定它对那个地方的第一判断。链接的位置和数量影响蜘蛛走不走得到,锚文本影响的是它走到之后,先以为这是什么。
蜘蛛从一条链接上能读到什么
一个链接元素里,蜘蛛至少能提取三部分:目标地址、链接文字、以及链接所在段落的上下文。在目标页还没被抓取之前,锚文本是它对这个地址的唯一描述。这段描述会参与几件事:判断这个 URL 要不要进入抓取队列、初步理解目标页的主题、以及在多个来源指向同一地址时形成一个大致共识。
所以锚文本首先是给机器看的标注,其次才是给用户看的入口。
四种常见的锚文本缺失
- 空锚文本。标签里只有地址、没有文字,比如纯图标按钮。蜘蛛拿到了 URL,但没有任何主题信息。
- 图片链接。图片的 alt 文字会被当作链接文字使用,alt 空着,效果等同于空锚文本。
- 通用词。整屏导航都写着“了解更多”“点击这里”“详情”,这些词在任何页面都成立,对理解目标页没有帮助。
- 脚本拼接。文字由前端脚本渲染后才出现在页面上,原始 HTML 里对应位置是空的,抓取阶段读不到。
锚文本和目标页面要对得上
如果一批链接都指向同一个页面,文字最好能描述这个页面本身的内容,允许在几个近义表达之间自然浮动。常见的反面做法有两种:一种是把同一组词反复塞进每一条链接,看起来很统一,实际读起来很生硬;另一种是用和目标页无关的词去凑,比如目标页在讲开票流程,链接却写“立即咨询”——这是动作指令,不是描述,对 URL 发现几乎没有贡献。
一个判断方法
把链接文字单独摘出来,遮住周围内容,看它能不能让人猜到目标页在讲什么。能猜出来,说明这段文字有效;猜不出来,它就是装饰。
模板生成的链接怎么管
导航、页脚、面包屑、相关推荐这些位置通常由模板批量输出,锚文本重复度极高。页脚的一整套栏目链接会在全站每个页面重复出现一次。这本身不算问题,但要注意两点:
- 模板链接的文字应该是栏目名本身,而不是菜单编号、图标名或英文缩写。
- 同一批链接不要堆在太多位置。重复的链接加重复的文字,对蜘蛛的增量信息接近于零。
内链改造时容易漏掉的地方
- 正文里的链接改了文字,导航却没同步,同一目标页出现两套完全不同的描述。
- 列表页把标题截断成前几个字,语义不完整,读起来像乱码。
- 上一页、下一页用箭头符号或单个标点,蜘蛛拿不到可用文字。
- 标签页、筛选条件的链接文字全是数字或单个量词。
不借助工具怎么抽查
先选一个你希望被更多抓取的页面,用站内搜索或站点范围查询,看它被哪些页面链接到,再逐个点开那些来源页,看链接周围的文字怎么写。如果一半以上的链接写的是“点击查看”“详情”,说明这个地址在站内几乎没有文字描述,蜘蛛只能靠别的信号来判断它是什么。
锚文本不是关键词投放位。把同一组词反复塞进链接,和把链接一律写成“了解更多”,本质是同一个问题:文字没有真正描述目标页面。
小结
内链结构决定蜘蛛能不能走到目标页,锚文本决定它走到之后如何理解这个页面。前者改一次,路径就通了;后者需要日常维护——每加一条链接,顺手把那几个字写对,成本很低,收益却会持续累积。