蜘蛛池入口頁通常只是一层中轉:它本身没有多少原创内容,真正的作用是让搜尋蜘蛛顺着頁面上的連結走到目标 URL。不少人為了不让這些空壳頁占住索引,會在入口頁加上 meta name=“robots” content=“noindex”。這样一来就出現一個常见疑問:既然頁面被标记為不收錄,里面的連結搜尋蜘蛛還會不會繼續跟進?
先分清抓取和索引是两件事
搜尋蜘蛛訪問一個 URL 的過程大致分两步:先把頁面抓回来(抓取),再决定要不要放進索引。noindex 影响的是後一步,也就是“不要收錄這個頁面”,它本身並不等于“不要来抓”。只要机器人能正常抓到這個頁面、並且讀到這行 meta 标簽,它仍然有可能解析頁面里的連結,並按正常規則去發現下一跳的 URL。
也就是说,入口頁寫 noindex 之後,目标 URL 被發現的机會通常還在,但有几個前提:
- 入口頁没有被 robots.txt 整段屏蔽——被屏蔽的頁面,蜘蛛看不到 noindex,也就無從判断;
- 頁面能正常返回 200,正文不是空白模板,連結是真實的 a 标簽 href;
- 入口頁仍在待抓队列里,没有因為長期不更新而逐渐淡出。
noindex 和 nofollow 不是一回事
很多人把這两個指令当成同一件事,其實它們管的方向不同:
- noindex:告诉搜尋引擎“這個頁面別放進索引”,但預設仍然允许跟進頁面上的連結,等價于 noindex, follow。
- nofollow:告诉搜尋引擎“別跟着這些連結走”,頁面自身可能照样被收錄。
- noindex, nofollow:两者同时生效,頁面既不收錄,連結也基本不再被当作發現途径。
如果入口頁的核心作用就是分發 URL,那么 noindex, nofollow 基本等于把這個入口頁废掉。這也是不少人明明把蜘蛛引来了、目标 URL 却迟迟没動静的原因之一:不是蜘蛛没来,而是它来了以後被告知別顺着連結走。
非 HTML 场景要用响應头
如果入口頁返回的不是 HTML,比如纯文本、JSON,或者以文件下载形式輸出,meta 标簽是寫不進去的,這时候要用 HTTP 响應头 X-Robots-Tag 来传達同样的指令。逻辑仍然一致:只寫 noindex 时,連結跟進通常不受影响;一旦叠加上 nofollow,連結發現能力就會明顯下降。
什么情况下入口頁适合寫 noindex
- 入口頁内容重复、價值很低,不希望它出現在搜尋结果里,但還想让它承担連結分發功能,用 noindex(不带 nofollow)即可。
- 入口頁只是临时中轉,随时可能下线或改结构,可以先 noindex,减少後續被收錄後再處理的麻烦。
- 入口頁本身质量尚可、能带来長尾訪問,一般不建议屏蔽,保留收錄反而更自然。
還有一種更常见的情况:入口頁本来就是希望被收錄、当作内容和流量资产的,那就不要寫 noindex,把精力放到让頁面有可讀内容、連結位置正常、加载稳定上。
怎么確認設定之後有没有效果
- 用站長平台的抓取诊断或網址检查工具,看目前返回的 HTML 和响應头,確認指令寫没寫、寫在哪一层。
- 在服務器日誌里筛出搜尋蜘蛛訪問入口頁的记錄,看它是否拿到 200,随後有没有出現對目标 URL 的抓取請求。
- 观察入口頁在索引里的狀態變化。正常情况下,noindex 生效後它會逐步從索引中消失,這個過程需要時間。
- 如果入口頁被索引、目标 URL 却一直没被抓,先回头检查入口頁連結和 nofollow 設定,而不是繼續加更多入口頁。
提示:noindex 的頁面並不保證永遠被抓。頁面長期不更新、缺少外部入口、抓取频率下降时,它的連結分發能力會慢慢變弱。把入口頁“保持可抓”当成日常维護項,比一次性铺量更實际。
總结一下:入口頁只寫 noindex,搜尋蜘蛛通常還會跟進里面的連結;寫 noindex, nofollow,連結發現基本被掐断;如果在 robots.txt 里屏蔽入口頁,則连 noindex 本身都可能讀不到。把這三者的区別弄清楚,比反复調連結數量更有用。