蜘蛛池知识

蜘蛛池入口頁的 meta 标簽:canonical、robots 與 noindex 该怎么设

入口頁的 meta 标簽容易被忽略,但它們會影响蜘蛛對頁面的判定和後續抓取。本文梳理 robots、canonical、noindex 在蜘蛛池入口頁上的常见用法,說明哪些组合會互相抵消,以及設定後该從日誌和索引狀態里检查什么。

蜘蛛池知识

蜘蛛池入口頁的 meta 标簽:canonical、robots 與 noindex 该怎么设

入口頁的 meta 标簽经常被忽略,因為它們不像連結和内容那样直接决定蜘蛛往哪走。但在實际运营里,robots、canonical 和 noindex 這几個指令會影响蜘蛛對入口頁的判定,设错了可能让入口頁白做。下面按常见场景拆開说。

robots meta:入口頁通常用 index,follow

頁面級 robots meta 控制的是“這個頁面能不能被收錄、頁面上的連結能不能被跟随”。入口頁的职责是让蜘蛛進来並顺着連結走到目标頁,所以預設應该是 index,follow。如果不希望入口頁出現在搜尋结果里,可以改成 noindex,follow,這样蜘蛛仍會抓取並跟連結,只是不把它放進索引。

不要用 noindex,nofollow,那等于告诉蜘蛛別跟頁面上的連結,入口頁就失去意义了。除非你確認這個頁面只是临时占位,不打算让它传递任何抓取路径。

canonical:別轻易指向目标頁

canonical 用来声明頁面的規范版本。入口頁如果内容重复度高,有人會想用 canonical 指向目标頁,希望把信号集中過去。但實践里這么做有几個問题:一是入口頁和目标頁内容主题往往不同,canonical 可能被蜘蛛忽略;二是如果被采纳,入口頁自身可能不再被單獨處理,影响它作為抓取入口的作用。

更稳妥的做法是入口頁 canonical 指向自己,或者干脆不加 canonical。多個入口頁之間如果真的高度相似,優先考虑改内容差异,而不是靠 canonical 硬合並。

noindex 的使用场景與風險

noindex 适合“不想被收錄、但需要被抓取”的入口頁。比如批量生成的入口頁,内容價值低,不希望占用索引名額,又希望蜘蛛跟連結,就可以用 noindex,follow。注意 noindex 需要蜘蛛實际抓取到頁面才能生效,所以不能同时用 robots.txt 禁止抓取這個頁面。两者叠加的结果是蜘蛛看不到 noindex,頁面反而可能被收錄或長期不更新。

常见错誤:在 robots.txt 里 Disallow 了入口頁路径,又在頁面里寫 noindex,以為双保險,實际是互相抵消。

其他 meta 的取舍

  • description:對抓取路径影响很小,寫不寫看入口頁是否可能被展示。如果用了 noindex,description 基本没有展示机會。
  • keywords:主流搜尋引擎早已不參考,不必花精力。
  • refresh:meta 刷新可以做跳轉,但不如 301/302 明确,蜘蛛對它的處理也不一致,入口頁跳轉優先用 HTTP 狀態碼。
  • viewport:如果入口頁可能被移動端蜘蛛抓取,加上移動适配的 viewport 是基本項。

設定後的检查习惯

meta 标簽改完後,不要只看代碼。隔一段時間查一下入口頁在搜尋引擎里的索引狀態,结合日誌看蜘蛛是否仍然按预期抓取。如果發現入口頁大量不收錄但抓取正常,通常是 noindex 生效了;如果抓取量骤降,先检查 robots.txt 和 meta robots 有没有互相冲突。

简單總结:入口頁想被收錄就用 index,follow;不想被收錄但還要跟連結就用 noindex,follow;canonical 尽量自指,別乱指向目标頁;robots.txt 和 meta robots 不要同时用来屏蔽同一個頁面。