站点地图先解决發現問题
搜尋引擎發現一個新 URL,通常有几條路:外部連結、站内連結、站点地图、以及搜尋资源平台的手動提交。站点地图的定位是批量声明可訪問 URL,让爬虫知道站内還有哪些頁面值得看一眼。它不等于收錄指令,也不保證抓取和索引。把 sitemap 当成收錄開關,往往會在提交後看不到预期變化。
哪些 URL 适合放進站点地图
站点地图應该尽量只包含希望被索引、且目前可正常訪問的規范 URL。判断时可以先過一遍基础條件:
- 返回 200 狀態碼,不是 301、302、404 或 5xx;
- 没有加 noindex,也没有被 robots.txt 屏蔽抓取;
- 是規范 URL,不是參數排序頁、追踪連結或重复變体;
- 内容有獨立價值,不是纯篩選结果或空聚合頁。
如果站点里存在大量低质聚合頁、标簽頁或參數頁,不要因為“想让它們被收錄”就全部塞進 sitemap。搜尋引擎會把 sitemap 当成一種信号,但最终仍會按頁面质量和索引预算做取舍。
维護 sitemap 时容易踩的坑
1. 只提交,不更新
頁面已刪除、已停用或已改版跳轉,sitemap 里還留着舊 URL,會让爬虫反复訪問無效地址,浪費抓取资源。定期清理已失效地址,比一次提交大而全的列表更有用。
2. lastmod 随意寫
lastmod 應该反映内容實质更新時間。如果每次發布都批量改寫所有頁面的 lastmod,這個字段會逐渐失去參考價值,甚至让搜尋引擎降低對它的信任。
3. 分片與索引文件混乱
URL 數量多时可以按栏目或類型分片,再用 sitemap 索引文件匯總。分片要便于维護和排查,不要把所有 URL 随机拆散,也不要让索引文件指向已经 404 的分片。
提交之後看什么
把 sitemap 提交上去,只是让 URL 進入發現队列。接下来更值得观察的是:
- 已提交的 URL 是否被實际抓取,抓取频率有没有變化;
- 抓取後是進入索引,還是停在“已發現”“已抓取未索引”等狀態;
- 若長期只被發現不抓取,检查頁面内鏈深度、服務器响應、URL 是否過度重复;
- 若抓取後不索引,回到内容质量、重复度和頁面價值上找原因。
這些信息可以结合抓取日誌和索引报告一起看,不要只用 site 查询數字下结论。
站点地图要配合内鏈使用
站点地图是补充入口,不是站内連結的替代品。重要頁面仍然需要有清晰的内鏈路径:首頁、栏目頁、相關文章、面包屑都可以帮助爬虫理解层級。一個頁面如果只出現在 sitemap 里,站内没有任何入口,就算被發現,也很难获得稳定的抓取和權重传递。
站点地图负责让 URL 被看见,收錄仍由頁面质量、抓取预算和索引策略共同决定。
總结一下:把 sitemap 当成“可抓取 URL 清單”来维護,只放規范、可訪問、有價值的頁面,保持更新,並和内鏈、内容质量一起看。這样它才能稳定發挥發現作用,而不是變成一份無人维護的舊地址列表。