新頁面發布後,最常见的焦虑是“為什么還没收錄”。但“收錄”這個词常被当成一件事,實际上它至少由三段组成:URL 被發現、被爬虫抓取、被索引並進入可展現狀態。把這三段拆開看,你才知道自己在等什么,也才知道该做什么。
一、先把等待拆成三段
- 發現:爬虫知道了這個 URL 的存在,把它放進待抓取队列。来源通常是内鏈、站点地图、外鏈或歷史抓取。
- 抓取:爬虫實际請求了這個 URL,拿走了 HTML。這一步能在服務器日誌里看到。
- 索引與收錄:内容被解析、评估,判定可以進索引;之後才可能在搜尋结果里出現。
三段之間没有固定的時間承诺。發現可能几分钟,也可能几周;抓取完到進索引,同样可能很快也可能拖很久。
二、發現环节:让 URL 尽早被看见
如果一個頁面只有首頁能点進去,或者只在 XML 站点地图里出現,它被發現的速度就取决于爬虫多久来一次。提升發現速度,優先級一般是:
- 從相關且已被抓取的老頁面加上正文内鏈,而不是只放在全站導航或頁脚。
- 把新 URL 放進站点地图,並保證站点地图本身被正常抓取,sitemap 里只放 canonical 指向的最终版本。
- 確認该 URL 不需要登入、不被 robots.txt 挡住、狀態碼是 200。
想驗證是否已被發現,看日誌里有没有對這個 URL 的請求;只看“已發現,尚未编入索引”這類狀態,只能說明它進了队列,不能說明抓取過。
三、抓取环节:抓到了不代表马上用
爬虫来了又走,没留下任何索引變化,是很正常的。抓取频次受站点整体质量、更新节奏、服務器响應速度影响。
- 服務器响應慢、频繁 5xx,會直接压低抓取频次。
- 頁面依赖大量 JS 渲染,抓取到的内容可能與用戶看到的不一致,判断也會更慢。
- 同一内容有多個 URL 版本时,抓取會被分散,主版本反而排到後面。
四、索引评估:最不确定的一段
抓取之後,頁面要過一遍质量判断:内容是否足够、是否與站内其他頁面高度重复、是否属于列表或篩選類模板、是否缺少上下文。這一段的时長没有外部工具可以直接干预,能做的只有把頁面本身做好。
常见拖慢因素包括:正文過短、由模板批量生成的近似頁面、标题與正文不匹配、頁面主要内容藏在图片里。
五、等待期该做與不该做的事
值得做
- 在日誌里確認抓取行為,区分“没被發現”和“抓了没進索引”。
- 补充内鏈,让頁面离首頁更近一点。
- 检查该 URL 是否與站内其他頁面重复,必要时做合並或 canonical 收口。
- 保持原有 URL 稳定,不要為了催收錄反复改地址。
不建议做
- 反复手動提交同一批 URL,或整站提交,容易稀释真正重要的頁面。
- 改标题、改正文後重新發布,把頁面当成新頁面再等一轮。
- 為了“看起来收錄多”批量生成低價值頁面。
六、什么时候该当成異常處理
如果某個 URL 長期没有被抓取,先按顺序排查:robots.txt 是否誤屏蔽、是否零内鏈的孤岛頁、服務器是否對爬虫返回異常狀態、是否被 noindex 或 canonical 指向了別處。若日誌顯示抓取频繁但仍不進索引,重点轉向内容與重复度,而不是繼續催抓取。
新頁面從發布到進索引,没有统一时長。把“等待”拆成發現、抓取、评估三段,你才能判断自己是在正常排队,還是鏈條上有一环断了。