新站上线後最常被問到的問题是:地址已经發出去了,為什么搜尋蜘蛛迟迟不来。URL 發現本身就是一條鏈路——入口可達、Sitemap 可用、内鏈能走通、服務器不拒绝訪問,任何一环断了,後面的抓取和索引都無從谈起。下面按時間顺序梳理冷啟動阶段可以先做的事,以及日誌里常见的卡点。
冷啟動前要確認的三件事
- 域名解析稳定,www 與非 www、http 與 https 只保留一個對外版本,其余做 301 跳轉。
- robots.txt 没有誤挡全站,重点检查 Disallow: / 這類歷史遗留規則。
- 服務器與 CDN 不對常见爬虫 UA 做拦截,防火墙規則里留出正常訪問通道。
第一步:让首頁和一級入口先通
首頁是绝大多數爬虫的起点。确保首頁 HTML 由服務端直接返回,不依赖脚本执行才能看到連結;主導航使用标准 a 标簽,href 寫完整路径而不是用事件绑定跳轉。如果一級栏目都藏在折叠菜單或脚本渲染里,爬虫能看到的入口可能就只剩首頁一個,抓取路径會非常窄。
抓取路径的宽度,取决于首頁上有多少條真實可点的連結。
第二步:Sitemap 與主動提交作為补充通道
Sitemap 的價值在于把暂时没有内鏈指向的地址也列出来,但它只是提供一份候選清單,並不保證抓取。新站的文件不宜過大,單文件控制在 5 萬條以内、未压缩不超過 50MB;lastmod 只寫真實改動時間,不要每次生成都刷新一遍。
Sitemap 與搜尋资源平台的提交入口可以並行使用,两者互不替代,但都不要指望提交後立刻有反馈。可以把它們看作“补位”的手段,而不是主力入口。
第三步:用内鏈把新地址串起来
- 新内容發布後,從相關舊頁面加一條上下文連結,让爬虫有路可走。
- 列表頁、归档頁、标簽頁保持可抓取,作為批量地址的入口。
- 避免整站只有“首頁 → 内容頁”的單层结构,也避免层級過深導致深處地址長期無人問津。
内鏈的意义是让爬虫在抓完一個頁面後自然走到下一個,而不是每次都依赖重新提交。對于新站来说,稳定增加的内鏈比一次性堆大量外鏈更容易被持續訪問。
常见卡点:日誌里看不到搜尋蜘蛛
- 入口被 robots.txt 或頁面 meta noindex 挡住;
- 連結由脚本渲染,HTML 源碼中找不到 href;
- 服務器返回 5xx 或响應時間過長,爬虫提前放弃;
- 存在大量重复地址或软 404,抓取资源被消耗在無效頁面上;
- 頁面之間連結形成閉环,新地址没有任何入口指向。
观察與調整的节奏
上线後建议以周為單位看服務器日誌里的爬虫訪問记錄:来訪频率、被抓取的 URL 分布、狀態碼分布。如果只有首頁被訪問,說明入口太窄;如果大量 404 被訪問,說明舊連結或歷史 Sitemap 還在被讀取。把爬虫 UA 的响應時間單獨监控,可以及早發現高峰期超时丢入口的情况。調整时一次只改一處,观察一周再判断效果。
冷啟動没有统一時間表,站点規模、更新频率、外部引用都會影响节奏。把入口铺平、把障碍清掉,剩下的交给時間,不建议用夸張手段去催。