很多人盯收錄,只看一個數字:收錄量涨了還是跌了。但收錄並不是一個開關,從蜘蛛第一次知道這個 URL,到它能被用戶搜出来,中間要经過几個环节。每個环节卡住的表現都不一样,笼统地说“没收錄”,很容易修错地方。
阶段一:URL 被發現
這是最前面的一步。蜘蛛得先知道這個地址存在,才可能去訪問它。常见的發現途径有几條:
- 站内連結,尤其是從已经被频繁抓取的頁面点出去的連結;
- 站点地图,适合數量大、内鏈入口少的頁面;
- 主動提交,能缩短發現時間;
- 外部連結带来的自然發現。
這一步容易被忽略,也容易造成假象。有的頁面在工具里顯示“已發現”,但可能几天都没被抓,因為待抓队列里排着的 URL 太多。發現只是排队,不代表會马上處理。
阶段二:被抓取
蜘蛛来了,能不能顺利把内容拿走,是第二個环节。這里常见的卡点包括:
- 服務器响應慢或者经常返回 5xx,蜘蛛會主動降低訪問频次;
- robots.txt 誤屏蔽,或者防火墙把蜘蛛拦在外面;
- 頁面主要靠 JS 渲染,抓取时拿到的只是一個空壳;
- 重定向鏈太長,跳几次之後放弃。
抓取成功,只說明蜘蛛拿到了東西,不代表它認可這個頁面。很多人看到日誌里有訪問记錄,就認為收錄没問题,這其實是把抓取和收錄混為一谈了。
阶段三:進入索引
這才是通常意义上的“被收錄”。搜尋引擎要判断:這個頁面值不值得留下来,和站内其他頁面、站外頁面比是不是重复,規范地址應该是哪一個。常见的分流情况有:
- 内容和其他頁面高度相似,被归並到另一個 URL;
- canonical 指向了別的地址,收錄记在別人头上;
- 頁面有效内容太少,被判定為價值不足,暂不索引;
- 參數、會话 ID 造成的多個副本,被合並成一個。
被索引的是“一個地址所代表的内容”,而不是你提交過几次。同样的内容,搜尋引擎通常只保留一個它認為最合适的版本。
阶段四:能被搜出来
被索引了,也不等于一定能在某個搜尋词下出現。索引和展現之間還隔着相關性、地域、设备、时效等因素。一個刚收錄的長尾頁面没有展現,是很正常的事,不代表收錄失敗。
也可能是另一種情况:頁面确實在索引里,但它對應的查询词本身就很冷门,几乎没人搜,自然也就看不到。
怎么判断卡在哪一步
與其反复問“收錄了吗”,不如按顺序排查:
- 發現了吗:這個 URL 有没有任何入口?站点地图里有没有、内鏈有没有指向它?
- 抓了吗:日誌或抓取工具里有没有對它的訪問记錄,返回的是 200 還是別的狀態碼?
- 内容取到了吗:抓取到的版本和用戶實际看到的版本是否一致?
- 進了索引吗:用站点查询或站長工具確認,注意查的是規范地址。
- 有展現吗:如果確認在索引里却搜不到,那多半是相關性和需求的問题,不是收錄問题。
每一步的修法都不同:入口缺失就补内鏈,抓取失敗就看服務器和屏蔽規則,内容重复就理清規范地址,没有展現就回头看看頁面有没有真正解决用戶的問题。
几個常见的誤判
- 把“没排名”当成“没收錄”,于是反复提交、反复改标题,越折腾越乱。
- 把“蜘蛛訪問過”当成“已经收錄”,忽略了後面的质量判断环节。
- 用某個精确查询词搜不到,就断定頁面没進索引,而這個词本身可能就不在頁面的语义范围内。
- 看到收錄量下降就紧張。索引本身有正常的新陈代谢,淘汰一批低價值頁面未必是坏事。
把收錄拆成“發現—抓取—索引—展現”四步之後,多數問题都能落到具体某一环上。分阶段排查,比盯着一個總數猜原因要可靠得多。