發布一篇新頁面之後,很多人第一反應是去搜标题,搜不到就認定出了問题。但從發布到能在搜尋结果里看到,中間要经過好几道關,每一關卡住的原因都不一样。把這几關分開看,排查才有方向。
第一關:URL 被發現
蜘蛛得先知道這個地址存在,才有可能来抓。常见的發現路径就這么几條:
- 站内連結:列表頁、相關内容模块、面包屑指向新頁面,這是最稳定的發現方式;
- 站点地图:适合批量提交,尤其是新栏目或一次上线几十個頁面时;
- 外部連結:其他站点的連結會带来額外發現机會,但不可控;
- 主動提交入口:能缩短發現時間,但不改變後續的判断逻辑。
這一關的典型症状是:日誌里完全看不到蜘蛛訪問该 URL。此时该检查的是連結是否可達、是否被 robots 挡住、提交是否真的生效,而不是反复修改正文措辞。蜘蛛池之類的工具作用也止步于此,它們能提高 URL 被發現的概率,但决定不了後面几關的结果。
第二關:排队等待抓取
被發現不等于马上被抓。站点的抓取资源有限,新 URL 會先進入队列,排队時間長短和站点整体抓取健康度、頁面所在目錄的深度、以及该目錄此前的抓取回报都有關系。
這個阶段日誌里可能只有零星几次訪問,也可能完全没有動作。能做的事不多:把新頁面挂到已经被频繁抓取的頁面附近,减少目錄层級,让入口更靠近首頁,比單獨催某一個 URL 更有效。
第三關:抓取與渲染
蜘蛛来了,但抓到的内容和用戶看到的不一定一样。如果主要内容依赖 JS 渲染,而渲染环节没走通,蜘蛛拿到的就是一個空壳。此时日誌顯示訪問正常,頁面却迟迟不進索引。
驗證方法很直接:把頁面 HTML 源碼(不是浏览器里右键检查的 DOM)複製出来,看看正文、标题、主要連結是否在里面。如果不在,先解决渲染問题,再谈收錄。
第四關:進入索引
抓取完成後,搜尋引擎還要判断這個頁面值不值得放進索引:内容是否和站内其他頁面高度相似、是否只是模板拼出来的薄内容、是否對用戶有獨立價值。這一關卡住,日誌上看不出異常,抓取频率也正常,就是索引狀態不動。
這时能改的是頁面本身:补充獨有信息、合並高度重复的頁面、给相似頁面做明确的取舍。單纯重复提交或加快抓取,通常改變不了结论。
怎么判断自己卡在哪一關
- 查日誌:有没有蜘蛛訪問该 URL,訪問了几次,返回什么狀態碼;
- 查抓取狀態:是「已發現尚未抓取」,還是「已抓取尚未编入索引」;
- 查源碼:正文和主要連結是否在原始 HTML 里;
- 查重复度:站内是否有另一條 URL 承载了几乎相同的内容。
常见卡点與對應動作
- 日誌零訪問 → 先查入口連結和 robots,別動正文;
- 有訪問但一直排队 → 優化内鏈位置,减少路径层級;
- 抓取了但索引不動 → 看内容质量和重复度,而不是抓取频率;
- 索引里有但搜不到 → 這是展示层的問题,和收錄不是同一件事。
四關之間是顺序關系,前一步没通過,後一步做什么都白費。排查时按顺序走,比同时改一堆東西更容易看出哪個動作起了作用。
最後需要一点耐心。新頁面的收錄本来就有延迟,几天到几周都算正常范围。與其每天反复提交,不如把入口連結、源碼可见性、内容獨立性這三件事做扎實,剩下的交给時間。