很多人查收錄問题,第一反應是去後台看索引數量和覆盖率报告。這些資料有用,但它們是结果。想知道過程卡在哪一步,得回头看服務器的訪問日誌——那里记錄的是蜘蛛真實来過之後做過什么。
先明确一点:日誌只能回答“它来過没有、看了哪些地址、拿到了什么结果”,不能回答“為什么没给我收錄”。後者是搜尋引擎的内部判断,日誌只是最接近答案的旁證。
一、把日誌按三條线拆開
不要一上来就統計總請求數,先按三個维度把日誌切開,問题往往自己就浮出来了。
- 時間线:哪几天来訪密集,發布新内容或改版之後是否有變化,有没有连續空白期。
- URL 线:同一批地址被反复抓取,還是從头到尾一次都没出現。
- 结果线:返回的狀態碼、响應耗时、實际返回的字节數。
這三條线交叉看,比只看任何單一指标都更接近真相。比如某個栏目頁每天被抓十几次、每次返回 200、返回体积正常,那問题大概率不在抓取,而在後續處理。
二、訪問频次:多不等于重视
- 高频集中在少數地址:通常是蜘蛛在反复確認某處變化,或者该頁每次返回都不太稳定。
- 低频且分散在很多地址:站点整体被当成低優先級,一般和内容更新节奏、站点整体质量、外部入口有關。
- 流量突然归零:先查 robots、防火墙與 CDN 規則,這類拦截在日誌里常常表現為直接断掉。
- 只抓首頁和少數几個栏目:多半是内鏈太深,或者列表頁長期不更新,蜘蛛没有繼續往下的理由。
三、狀態碼:不同返回對應不同卡点
- 200:抓取本身没問题,卡点在抓取之後的處理环节,比如内容质量、重复度過高、索引排队。
- 301 / 302:確認跳轉目标是否可抓、鏈路是否過長,两三次以上的鏈路會明顯削弱抓取意愿。
- 404:站内連結指到了不存在的地址,白白消耗抓取次數,也影响蜘蛛對站点结构的信任。
- 403:常见于權限設定或安全策略誤伤,蜘蛛拿不到内容,後續自然無從谈起。
- 429 / 503:服務端在限速,蜘蛛會主動降低訪問频次,恢复需要時間。
- 5xx 與超时:响應太慢會让蜘蛛進入退避狀態,抓取频率下降往往比想象中更持久。
四、抓取深度與入口路径
把蜘蛛的抓取顺序和站内連結结构對照一下,能看出不少問题。典型情况有几種:重要頁面只有 sitemap 一個入口,站内没有任何連結指向它;点進深层頁面需要经過四五個列表頁,抓取到一半就停了;導航和面包屑指向的分類頁,日誌里几乎看不到。
如果某個 URL 反复出現在日誌里但從没被抓過(只是被“發現”),重点看它周围的内鏈是否太少、入口是否太偏。
五、日誌和索引狀態對照着看
- 有抓取、未索引:問题在抓取之後,重点排查内容重复、模板雷同、正文過短、與已有頁面高度相似。
- 無抓取、未索引:問题在發現环节,检查内鏈、sitemap、提交入口是否通畅。
- 有抓取、已索引但流量低:這是排序問题,不是收錄問题,別再把功夫花在抓取上。
六、几種容易被日誌“露馅”的做法
伪造 User-Agent 的訪問、用脚本制造的假流量,只會出現在自己的日誌里,不會改變搜尋引擎的判断。日誌分析的價值在于發現問题,不在于制造資料。
同样,短時間内大量提交 URL 或频繁改動 robots,也會在日誌里留下痕迹——蜘蛛的抓取节奏被打乱,恢复需要時間。
七、一份最小排查流程
- 導出最近 7 到 30 天的日誌,筛出搜尋引擎的 User-Agent。
- 統計每個 URL 的抓取次數、狀態碼分布、平均响應時間。
- 把目标 URL 分成三類:有抓取、無抓取、只被 4xx/5xx 命中。
- 對“無抓取”的一類,回到站点检查内鏈和 sitemap;對“有抓取”的一類,回到頁面本身检查内容與重复度。
- 修完之後隔两三周再看一次日誌,對比同一批 URL 的抓取次數與狀態碼是否變化。
日誌不是一次性工具。把它当成常規巡检的一部分,收錄問题大多能在早期看出苗头,而不是等到索引數量掉下来才開始找原因。