做蜘蛛池的时候,入口页经常被当成“链接中转站”:一个页面里堆几十上百条链接,正文一句没有。这种页面能不能被搜索蜘蛛抓到、里面的链接能不能被跟进,是很多人反复问的问题。先说结论:纯链接页通常仍然可以被抓取和解析,但它在抓取队列里的待遇,往往不如一个有正文、结构正常的页面。
搜索蜘蛛发现 URL 的三个环节
把“发现”拆开看会清楚很多:
- 抓取入口页:蜘蛛请求入口页地址,拿到 HTML。
- 解析链接:从 HTML 中提取可抓取的 a 标签 href,转成绝对 URL,并做去重。
- 进入队列:把新 URL 放进待抓取队列,之后按调度策略决定什么时候来抓。
纯链接页影响的主要是第二、第三步:链接能解析出来,但调度时优先级可能被压低,抓取节奏变慢。
纯链接页会发生什么
入口页只有一堆 a 标签,没有正文、没有标题层级、没有可读内容,对搜索引擎来说属于典型的低价值页面。常见表现是:
- 入口页本身可能被抓,但抓取频率低,长期停留在“偶尔来一次”。
- 页面里的链接不一定全部被跟进,尤其是数量很大、又指向同一批目标的时候。
- 如果整站都是这种模板化页面,入口页容易被归入链接农场一类,抓取预算被压缩。
注意,这不是“一定不抓”,而是抓的节奏和覆盖面会明显受限。
加一点正文,变化在哪里
入口页不需要写成深度长文,但有几个元素会让它更像一个正常页面:
- 有明确标题:h1 里写清楚这页在讲什么,而不是“链接列表”“友情链接”。
- 有 150 到 400 字正文:围绕入口页主题写点真实内容,把目标链接自然嵌进上下文。
- 链接数量可控:一页放十几到几十条,比几百条更容易被完整处理。
- 页面结构干净:不要整屏靠 JS 渲染链接,也不要必须点击展开才出现 href。
这些做法不会让抓取变成确定的事,但能降低“入口页被抓了、目标链接却没被跟进”的概率。如果目标 URL 本来就在同一站点内,入口页还可以顺带承担导航作用,让链接出现在有上下文的位置,而不是孤零零地排成一行。
一个小验证方法
拿两批入口页做对比:A 组纯链接,B 组带正文。看两周内服务器日志里搜索蜘蛛对目标 URL 的请求次数和首次到达时间。站点权重、抓取预算不同,结果不会一致,但方向通常能看出来。
几个常见误区
- “正文只是给算法看的装饰”:正文的作用是让入口页成为一个能被理解的页面,而不是为了骗过谁。
- “复制同一段正文到所有入口页就行”:批量复制的正文和没有正文区别不大,甚至更像垃圾页。
- “入口页有正文,目标页就一定有排名”:发现、抓取、收录、排序是四件事,入口页只影响最前面那一环。
入口页的职责是把 URL 送到蜘蛛面前,不是替代目标页做内容。把入口页做得“像一个正常页面”,通常比单纯堆链接数量更有效。
如果时间有限,优先做三件事:给入口页写一个真实标题、补一段能读的正文、把链接数量降到可维护的范围。剩下的交给日志去验证,别靠猜。