網站收錄

頁面没進索引,先核對 noindex、canonical 和 robots.txt 這三處設定

抓取正常、内容也不差,頁面却迟迟進不了索引,很多时候問题不在质量,而在設定。本文按 noindex、canonical、robots.txt 三處逐一說明常见誤配與核對方法,並给出一個可复查的處理顺序,帮站点先把開關型問题排除掉。

網站收錄

頁面没進索引,先核對 noindex、canonical 和 robots.txt 這三處設定

抓取日誌里有记錄,内容也不是拼凑的,但索引里始终搜不到,這種情况很容易被归到“頁面质量不够”。在動内容之前,先把三處設定核對一遍,通常更省時間:noindex、canonical、robots.txt。它們属于開關型問题,一旦配错,頁面本身再好也拿不到收錄机會。

一、noindex:最直接的拒绝收錄

noindex 常见有两種寫法:一種是頁面 head 里的 meta 标簽,另一種是服務器返回的 X-Robots-Tag 响應头。後者往往優先級更高,而且不出現在頁面源碼里,只看 HTML 很容易漏掉。

  • 模板繼承:列表頁、篩選頁、打印頁的模板被複製到詳情頁,禁止收錄的指令跟着一起带了過去。
  • 响應头注入:CDN、安全插件或測試环境用的規則被同步到了正式环境。
  • 批量規則過宽:為了控制參數頁,给带參數的 URL 统一加了 noindex,结果正規詳情頁也被覆盖。

核對方式很直接:抓一次頁面源碼看 head,再用抓取工具或接口看响應头,两處都要確認。

二、canonical:指错方向等于把頁面让出去

canonical 声明的是這一组内容里應该被索引的代表版本。寫错方向时頁面不會报错,但收錄机會會被轉移到別的 URL 上。

  • 相對地址解析異常:寫成本地路径,却被解析到了错誤域名或层級。
  • 协议與主机名不统一:http 指向 https,带 www 與不带 www 混用。
  • 多版本互指:同一内容的多條 URL 各自 canonical 到自己,等于没有声明。
  • 分頁指向第一頁:詳情頁被合並,長期拿不到獨立索引。

處理原則是让每個頁面的 canonical 指向自身或真正唯一的代表版本,並保持协议、主机名、路径寫法一致。

三、robots.txt:拦住抓取,也拦住了後續判断

robots.txt 的 Disallow 只阻止抓取,並不直接阻止索引,這带来两個容易誤判的情况:被拦住的 URL 可能出現在索引里却没有正常摘要;頁面本来就没被抓到,即使再补一條 noindex 也不會生效,因為机器没机會讀到它。

所以当 robots.txt 與 noindex 同时使用时,要先確認顺序:先放開抓取,再让 noindex 生效,最後才是提交與观察。反過来做,往往只會看到“抓取量正常但收錄不動”的假象。

四、一個可复查的核對顺序

  1. 確認目标 URL 是否允许抓取,robots.txt 有没有誤拦整站或目錄。
  2. 查看响應头里是否有 X-Robots-Tag,頁面返回狀態碼是否為 200。
  3. 查看頁面 head 里的 meta robots 是否被模板繼承。
  4. 確認 canonical 指向自身或正确的代表版本,寫法與协议保持统一。
  5. 修改完成後重新抓取一次,隔几天再查索引狀態。

把改動记錄下来

設定類問题容易被反复踩,建议用一張简單的表记錄:URL、問题類型、修改時間、修改内容、复查日期。同一批頁面集中出問题时,表格能让規律更快顯現,比如它們是否都来自同一個模板或同一次發布。

設定层面的問题通常比内容問题好修,也更容易被忽略。頁面不進索引时,先花十分钟排掉這三處開關,再谈内容調整會更有方向。