搜尋抓取

新域名與新站起步期:從零搭建 URL 發現路径的顺序

新站没有歷史抓取记錄,URL 發現要從零建立。本文按顺序梳理起步動作:先让首頁成為清晰出發点,用浅层級挂载首批内容,让站内連結與 Sitemap 分工互补,並說明提交後该看日誌里的哪些信息、起步阶段服務器要注意什么,以及几個常见誤区。

搜尋抓取

新域名與新站起步期:從零搭建 URL 發現路径的顺序

新域名上线时,搜尋引擎對站点的了解是空白的:没有歷史抓取记錄,也没有已知的内鏈结构。這個阶段的 URL 發現效率,主要取决于站点能否用最短的路径讲清楚“從這里出發可以走到哪些頁面”。下面這套顺序的目标是降低發現成本,而不是保證一次提交就有结果。

一、让首頁成為清晰且唯一的出發点

首屏可见的連結越明确,從首頁出發的可選路径就越确定。導航栏、面包屑、正文里的锚文本,都属于稳定入口。反過来,把首頁做成整屏轮播图、或者導航完全由脚本渲染,等于把路标藏了起来。蜘蛛到站後第一件事是找連結,找不到就只能空手离開。

二、用尽量浅的层級挂载首批内容

起步阶段内容量有限,没必要急着铺深栏目。可以先把核心的二十到五十個頁面,通過首頁或一級栏目直接鏈到。层級越浅,從首頁能走到的 URL 越多,中間环节出错的机會也越少。

  • 栏目頁放在主導航里,URL 定下来後尽量別改;
  • 内容頁至少有一條来自栏目頁或相關推荐的内鏈;
  • 避免出現只在 Sitemap 里提到、站内任何連結都到不了的頁面。

三、Sitemap 是补充入口,不是替代入口

XML Sitemap 能帮蜘蛛更快知道有哪些 URL 存在,但它不负责维持抓取路径。一個只在 Sitemap 出現、站内没有任何連結指向的頁面,通常拿不到稳定的抓取回訪。合理分工是:站内連結负责把 URL 组织成網状,Sitemap 负责把清單交出去,两邊内容尽量對齐,別一個多一個少。

四、robots.txt 先放行再收紧

新站常见的做法是先让 robots.txt 放行全站,等抓取路径稳定後再针對性拦截後台、搜尋结果頁這類不值得被抓的地址。起步阶段就大范围 Disallow,容易出現“站点看起来没什么可抓”的错觉,反而拖慢發現节奏。

五、起步阶段的服務器要求

新域名没有稳定的抓取配額,几次超时或 5xx 就足以让蜘蛛降低回訪意愿。這個阶段值得確認的几件事:

  • 首頁與栏目頁的响應時間是否稳定,尤其在没有缓存命中时;
  • HTML 是否由服務端直接輸出,而不是等脚本执行完才有連結;
  • 是否存在 www 與非 www、http 與 https 同时可訪問的情况;
  • CDN 回源是否正常,別让蜘蛛拿到空白頁。

六、提交之後看什么

提交 Sitemap 或做主動推送只是告知,不等于被抓取。真正有用的信号在服務器日誌里:哪些 URL 被訪問過、狀態碼是什么、Referer 是哪條連結带進来的。如果某個頁面始终没有任何抓取记錄,先回头看它在站内有没有入口,而不是反复重新提交。已经抓取但狀態碼異常的 URL,則要優先修复,而不是新加更多地址。

起步期最忌讳的是路径反复變動:今天改目錄,明天換 URL 規則,蜘蛛每来一次看到的都是新结构,之前积累的路径認知會被清零。

七、几個常见誤区

  • 一次性提交几千個 URL,但站内實际只有几十條連結支撑;
  • 為了首頁“干净”,把導航連結換成不可点击的图片;
  • 内容刚上线就改标题和 URL,導致發現记錄對不上;
  • 只盯着提交结果,忽略日誌里真實的抓取行為。

把入口理顺、层級压浅、内鏈與 Sitemap 對齐、服務器保持稳定,這四件事做到位,URL 發現會随着抓取回訪次數增加逐步進入正循环。剩下的就是按节奏更新内容,並定期從日誌里核對哪些地址還没被走到。