蜘蛛第一次访问一个站点时,并不会凭空知道所有 URL。它需要一个起点,也就是入口页。入口页决定了蜘蛛首轮能顺着哪些链接往下走,也间接影响新页面被发现的顺序。把入口页安排好,比单纯堆外链更直接。
蜘蛛常见的几个起点
- 首页。多数站点最自然的入口,导航和栏目链接都集中在这里。
- 外链指向的具体页面。外部链接给的 URL 会成为蜘蛛的入口,不一定是首页。
- Sitemap 中的 URL。提交后蜘蛛会按清单逐个访问,每个 URL 都可能成为局部起点。
- 主动提交的 URL。在搜索资源平台提交后,蜘蛛从该 URL 开始抓取。
- 历史抓取记录。老站被蜘蛛记住的 URL 会定期回访,再从这些页扩散。
入口不同,首轮抓取范围差很多
如果蜘蛛从首页进入,而你首页的导航、栏目、列表页都能正常爬,它很容易在首轮就触达大量详情页。反过来,如果外链指向的是一个正文页,那个页面没有回首页的链接,也没有相关推荐,蜘蛛抓完这一页可能就停住了,只能等下一次从别处再来。
这也是为什么同一个站,有的页面很快被发现,有的几个月都没动静。差别往往不在页面本身,而在蜘蛛是从哪个入口走到它的。
入口页本身要满足的条件
- 返回 200:入口页跳转、报错都会让路径断掉。
- 链接可爬:用 JS 渲染出来的导航,蜘蛛未必能拿到,入口页的链接最好在 HTML 里就有。
- 链接数量合理:入口页链接太少,扩展范围有限;太多又可能让蜘蛛分散。
- 服务器稳定:入口页响应慢或超时,蜘蛛可能降低对这个站的抓取频率。
新站和新目录,主动给一个入口
- 从首页或已有栏目页加一个指向新目录的链接,别让新页面孤立存在。
- 更新 Sitemap,把新 URL 放进去,让蜘蛛有清单可循。
- 如果需要外链,尽量指向新目录的入口页,而不是零散的内页。
- 在搜索资源平台提交入口页 URL,观察抓取记录,确认蜘蛛确实走到了。
入口页不是一次性设置
蜘蛛会回访,但回访的路线会跟着站内链接变化。栏目改版、导航调整、页面下线,都可能让原本顺畅的入口路径断掉。定期用日志或抓取工具看一下蜘蛛实际从哪些 URL 进入、又从哪些页离开,比凭感觉猜测更可靠。
入口页的任务不是自己排得好,而是让蜘蛛能顺着它走到下一层。
自查清单
- 首页和主要栏目页能否被正常抓取?
- 新目录是否有至少一个内链入口?
- 入口页的导航链接是否写在 HTML 中?
- 最近有没有整段路径因为改版而断开?