新域名上线时,搜尋引擎對站点的了解是空白的:没有歷史抓取记錄,也没有已知的内鏈结构。這個阶段的 URL 發現效率,主要取决于站点能否用最短的路径讲清楚“從這里出發可以走到哪些頁面”。下面這套顺序的目标是降低發現成本,而不是保證一次提交就有结果。
一、让首頁成為清晰且唯一的出發点
首屏可见的連結越明确,從首頁出發的可選路径就越确定。導航栏、面包屑、正文里的锚文本,都属于稳定入口。反過来,把首頁做成整屏轮播图、或者導航完全由脚本渲染,等于把路标藏了起来。蜘蛛到站後第一件事是找連結,找不到就只能空手离開。
二、用尽量浅的层級挂载首批内容
起步阶段内容量有限,没必要急着铺深栏目。可以先把核心的二十到五十個頁面,通過首頁或一級栏目直接鏈到。层級越浅,從首頁能走到的 URL 越多,中間环节出错的机會也越少。
- 栏目頁放在主導航里,URL 定下来後尽量別改;
- 内容頁至少有一條来自栏目頁或相關推荐的内鏈;
- 避免出現只在 Sitemap 里提到、站内任何連結都到不了的頁面。
三、Sitemap 是补充入口,不是替代入口
XML Sitemap 能帮蜘蛛更快知道有哪些 URL 存在,但它不负责维持抓取路径。一個只在 Sitemap 出現、站内没有任何連結指向的頁面,通常拿不到稳定的抓取回訪。合理分工是:站内連結负责把 URL 组织成網状,Sitemap 负责把清單交出去,两邊内容尽量對齐,別一個多一個少。
四、robots.txt 先放行再收紧
新站常见的做法是先让 robots.txt 放行全站,等抓取路径稳定後再针對性拦截後台、搜尋结果頁這類不值得被抓的地址。起步阶段就大范围 Disallow,容易出現“站点看起来没什么可抓”的错觉,反而拖慢發現节奏。
五、起步阶段的服務器要求
新域名没有稳定的抓取配額,几次超时或 5xx 就足以让蜘蛛降低回訪意愿。這個阶段值得確認的几件事:
- 首頁與栏目頁的响應時間是否稳定,尤其在没有缓存命中时;
- HTML 是否由服務端直接輸出,而不是等脚本执行完才有連結;
- 是否存在 www 與非 www、http 與 https 同时可訪問的情况;
- CDN 回源是否正常,別让蜘蛛拿到空白頁。
六、提交之後看什么
提交 Sitemap 或做主動推送只是告知,不等于被抓取。真正有用的信号在服務器日誌里:哪些 URL 被訪問過、狀態碼是什么、Referer 是哪條連結带進来的。如果某個頁面始终没有任何抓取记錄,先回头看它在站内有没有入口,而不是反复重新提交。已经抓取但狀態碼異常的 URL,則要優先修复,而不是新加更多地址。
起步期最忌讳的是路径反复變動:今天改目錄,明天換 URL 規則,蜘蛛每来一次看到的都是新结构,之前积累的路径認知會被清零。
七、几個常见誤区
- 一次性提交几千個 URL,但站内實际只有几十條連結支撑;
- 為了首頁“干净”,把導航連結換成不可点击的图片;
- 内容刚上线就改标题和 URL,導致發現记錄對不上;
- 只盯着提交结果,忽略日誌里真實的抓取行為。
把入口理顺、层級压浅、内鏈與 Sitemap 對齐、服務器保持稳定,這四件事做到位,URL 發現會随着抓取回訪次數增加逐步進入正循环。剩下的就是按节奏更新内容,並定期從日誌里核對哪些地址還没被走到。