蜘蛛发现 URL 主要靠两条路:Sitemap 清单和站内链接。Sitemap 给的是“名单”,内链给的是“关系”。同一批 URL,从不同位置、用不同锚文本链出去,蜘蛛的抓取意愿和后续判断并不一样。这一篇只谈内链这一侧:一条链接上到底带着哪些信息。
一条链接不是只有一个 URL
把内链理解成“把地址放上去”,会漏掉很多信息。蜘蛛解析一条 a 标签时,拿到的是一个信息包:href 指向的地址、锚节点的文字、链接所在的区块、紧邻的正文段落、前后的标题层级、rel 属性,以及这条链接在站内出现的次数和位置分布。
这些信息合在一起,决定了蜘蛛要不要跟、跟着抓一次还是反复抓。URL 本身只是其中一项。
锚文本:给目标 URL 贴的第一个标签
锚文本是链接里最直接的一段文字,蜘蛛会把它和落点页面做关联。同样是链向一个页面,写法不同,传递的信息密度差别很大。
描述性锚文本
能说明落点内容是什么的锚文本,比如“内链结构的排查步骤”“抓取日志怎么看字段”,落点页面和链接来源之间语义是连着的。这类链接在站内重复出现时,指向也一致,蜘蛛对落点的判断会更稳定。
泛词锚文本
“点击这里”“更多”“详情”这类锚文本,本身不携带信息,蜘蛛只能靠周围正文和落点页面自己判断。少量出现问题不大,如果全站主要靠这类文字串起内链,URL 之间的关系就变得很模糊。
链接周围的文字同样被读取
锚文本不是孤立生效的。链接前后的句子、所在段落的主题、上下级标题,都会一起被解读。一段话里如果反复出现某个主题,链接指向该类页面,蜘蛛对这条链接的意图判断会更清楚。
反过来,正文里突然插一条与上下文无关的链接,比如一段讲服务器配置的文字里链向产品页,这条链接的上下文信号是断的。偶尔为之无所谓,成规模出现时,链接的价值会被稀释。
链接位置影响跟不跟
同一批链接放在不同区块,被抓取的情况不一样:
- 主导航:出现在全站每个页面,稳定但数量有限,通常对应栏目级 URL。
- 正文首屏:距离页面主题最近,链接意义明确。
- 正文中部:常见的相关内容推荐位,适合把深一点的页面带出去。
- 侧栏:位置固定、更新少,容易被当成模板内容。
- 页脚:全站重复,数量一多就接近模板噪音。
规律大致是:出现在不同页面的正文里、且指向一致的链接,比固定区块里堆出来的链接更值得长期保留。
什么样的内链更容易被持续跟
要让蜘蛛反复走到某个页面,链接本身得具备几个条件:
- 落点返回正常状态码,不是 404、不是软 404。
- href 里是真实地址,而不是靠点击事件才生成。
- 来源页面本身被抓取频率正常,不处在长期不被访问的位置。
- 链接在站内多个相关页面里自然出现,而不是一次性全站铺开几百条。
- 落点页面有实际内容,不是空壳列表或占位页。
这几条里,第一条和第五条最容易被忽略。链接加得再漂亮,落点打不开或没内容,蜘蛛来一次就不会再来。
加内链时常见的几个误区
锚文本堆关键词。同一个词反复塞进锚文本,读起来不像正常链接,站内链接的可信度反而下降。
全站页脚塞链接。几百条链接出现在每个页面的页脚,实际能获得的跟访很有限,还占用了来源页面的抓取注意力。
只加不看。链接加上就不管,落点改版、下线、换地址后没有同步处理,站内长期挂着一批打不开的链接。
一份简化的内链自查清单
- 抽查栏目页和详情页,看正文里的链接是否指向相关页面。
- 统计站内链接的锚文本分布,泛词占比是否过高。
- 用抓取日志核对:常被访问的页面,是否正是内链指向最集中的页面。
- 检查页脚、侧栏的链接数量,是否已经超出正常导航范围。
- 抽查一批内链落点,确认状态码和内容都正常。
内链的作用不是“让蜘蛛知道有这个地址”,而是让蜘蛛知道这个地址是什么、值不值得来。把链接放回正文的语境里,比把链接铺满全站的边角更有效。