很多人讨论收录,第一反应是提交站点地图、发外链、想办法让蜘蛛多来一趟。这些动作都没错,但它们解决的是「让搜索引擎知道有这个地址」。在此之前还有一步常被忽略:蜘蛛在你站内爬行时,能不能顺着链接走到这个页面。站内链接是站主完全可控的一条发现路径,也是不少页面迟迟不进索引的真正卡点。
蜘蛛发现一个 URL,通常有三条路
一是外部链接,二是站点地图,三是站内已有的链接。外链要看别人给不给,站点地图更多起辅助和提示作用,真正稳定、持续运转的,是站内链接构成的爬行网络。新页面只要能从某个已经被抓取的页面点进去,就有机会被顺带发现。
站内链接没做好,常见是这几种样子
- 孤岛页面:用户能通过搜索框或筛选列表访问,但没有任何一条静态链接直接指向它。
- 只从首页出发:所有链接都堆在首页,深层页面彼此之间没有任何连接,一旦离开首页就无路可走。
- 导航靠脚本生成:用户点得到,蜘蛛拿到的 HTML 里却只有一个空容器。
- 链接被挡在外面:nofollow、robots 规则或登录墙,把本该传过去的路径掐断。
- 链接过度集中:几百个页面都指向同一个热门页,新上线的页面却没人指向。
让重要页面「有路可走」
缩短从入口到目标的链路
蜘蛛的爬行有预算,层级越深,到达的概率越低。重要的栏目页和内容页,尽量控制在三到四次点击以内;如果能通过栏目、标签、相关推荐等多条路径到达,被发现的机会会更稳一些。
链接文字要有信息量
「点击这里」「更多」这类锚文本,对判断目标页面的主题几乎帮不上忙。用能概括目标页面内容的短语,既方便用户判断,也让蜘蛛更容易理解这个链接指向什么。
别把所有链接都压在一个页面
把上百条链接塞进一个列表页,效果往往不如分散到几个相关的聚合页。链接分布得自然一些,单个页面的链接数量也更容易被正常处理。
内链不是越多越好
反过来,为了「让蜘蛛多爬」而在正文里堆满无关链接,或者在全站每一页都铺同一批推荐位,容易被当成链接堆砌,反而稀释了真正该被关注的内容。内链的基本原则是相关性:这个链接对正在读这一页的人有没有用。有相关性,数量少一点也没关系。
被发现,不等于被收录
站内链接解决的是「蜘蛛能不能找到这个地址」。收录与否还要看页面本身的质量、内容是否与其他页面重复、是否值得单独建立一个索引条目。链路通了,只是把页面送进了候选名单。
所以有时你会看到:页面早就被蜘蛛抓过,状态却一直停在「已抓取,尚未编入索引」。这时候再回头检查内链,帮助不大,该看的是内容与页面质量本身。
可以马上做的一次检查
- 挑几个迟迟没收录的 URL,逐一确认它们能从哪些页面链接到。
- 如果只能从搜索框、筛选器或脚本渲染的模块进入,先补一条静态入口。
- 检查这些入口页本身有没有被抓取,别让链路断在中间。
- 在抓取日志里看一眼:蜘蛛是否真的访问过这些入口页和目标页。
收录是多个环节叠加的结果,站内链接只是其中最容易被自己掌控的一环。把它理顺,至少能排除「蜘蛛根本走不到」这一类相对低级的问题。