頁面發出去几天,日誌里搜不到這個 URL,站長平台的抓取记錄也是空的。這时候很容易得出一個结论:蜘蛛不来。但在把問题归到蜘蛛身上之前,更值得先確認一件事——站内有没有一條正常、可抓取的連結,把蜘蛛领到這個地址上。發現和抓取是两件事,後者以前者為前提。
先把發現、抓取、索引三段拆開
一個新 URL 要走完大致三步,卡在哪一步,處理方式完全不同。
- 發現:搜尋引擎從站内連結、sitemap、外鏈等渠道知道這個地址存在。
- 抓取:排到队之後,蜘蛛真的發起了一次請求,日誌里能看到记錄。
- 索引:抓回去的内容经過處理,再判断要不要留下。
日誌里完全没有請求记錄,說明還没走到第二步。此时去纠结頁面内容质量、關鍵詞布局,方向就偏了,問题大概率出在發現层。
内鏈入口往上查的五個点
是不是一座孤岛
最直接的情况:這個 URL 只出現在 sitemap 里,任何頁面上都没有指向它的連結。孤岛頁面的發現速度完全依赖其他通道,慢是常態。
入口頁自己能被抓吗
如果唯一指向新頁的入口,本身被 robots.txt 屏蔽、被 nofollow 标记,或者需要登入才能看到,這條路径等于不存在。顺着鏈路往回查一层,往往就能找到断点。
從首頁点几次能到
常见的新頁面入口是某個频道頁或列表頁。如果從首頁到它要经過四五层跳轉,而這几层里又有一层長期不更新,蜘蛛不一定每次都往里走。新的、重要的頁面,尽量让它落在更浅的位置,或者临时從一個抓取频繁的頁面上给一個入口。
連結是不是寫成了蜘蛛讀不到的形式
以下几種寫法,人能看到,蜘蛛不一定能跟上:
- 用 JavaScript 点击事件跳轉,連結没有出現在 HTML 里;
- 需要提交表單或点击按钮才生成的地址;
- 寫在 iframe 或需要登入後才能加载的区域里;
- 用 onclick 加資料属性拼出来的路径,而不是标准的 a 标簽 href。
這些情况下,連結對用戶有效,對發現环节却可能無效。
入口頁是否被大量連結稀释
一個列表頁如果挂着几千條連結,其中大部分是重复的篩選组合或分頁跳轉,新頁面的入口很容易被淹没。這里不用做复杂優化,先让真正重要的入口出現在稳定、干净的位置上。
按這個顺序動手排查
- 在站内搜尋這個 URL,看有没有頁面上出現過它;
- 找到所有入口頁,逐個確認它們自身可被抓取、返回正常狀態碼;
- 確認連結是标准 a 标簽,href 指向最终地址,而不是中間跳轉;
- 計算從首頁到目标頁的点击深度,過深就补一條更浅的入口;
- sitemap 保持更新,但把它当补充通道,不当唯一通道。
内鏈做得好,只是让蜘蛛更容易發現一個 URL;它不保證一定被抓,更不保證一定進索引。這两步還取决于頁面本身和站点整体的抓取安排。
几個容易走偏的判断
- “sitemap 提交了就够了”:sitemap 解决的是“知道有這個地址”,不解决“值得跑一趟”。
- “随便给個連結就行”:入口頁本身的抓取频率和稳定性,會影响蜘蛛走到這里的概率。
- “日誌里没记錄,就是頁面质量差”:没被抓之前,质量還没進入评判环节,先解决發現和入口問题。
把這三段分清楚,很多“蜘蛛不来”的困惑,會變成一條可以逐項核對的鏈路清單。