一個頁面能不能被收錄,第一步不是内容质量,而是蜘蛛有没有走到它。除了 sitemap 和手動提交,日常最稳定、也最容易被忽略的發現路径是站内連結。連結怎么铺、頁面离首頁有多遠,會直接影响蜘蛛撞见它的概率和频率。
蜘蛛是怎么走到新頁面的
搜尋引擎通常從一批已抓取的頁面出發,顺着頁面上的 a 标簽繼續爬。sitemap 更像是线索清單,帮助發現 URL,但不等于會被抓取,更不等于會被收錄。真正的爬行路径,多數时候還是站内連結。
- 首頁、栏目頁、列表頁、詳情頁之間的常規跳轉;
- 相關推荐、上一篇/下一篇、标簽聚合;
- 面包屑、HTML 版站点地图頁、全站導航;
- sitemap、外鏈、提交接口等辅助入口。
連結深度:粗略但好用的一把尺
連結深度一般指從首頁出發,最少点几次連結能到達目标頁。它不是硬指标,但能反映可達性的好坏。
- 1–2 层:通常是導航、栏目、重点聚合頁,被抓取相對稳定;
- 3–4 层:多數詳情頁的正常区間,依赖列表頁和内鏈支撑;
- 5 层以上:往往要翻很多次分頁或多級聚合才能到達,抓取频次容易偏低;
- 只能通過 sitemap 找到、站内没有入口的頁面:属于孤儿頁面,抓取和更新都比較被動。
深度只是影响因素之一。同样深的頁面,如果外部連結多、更新频繁、被其他頁面引用得多,抓取表現也可能明顯更好。
让重要頁面离首頁更近的做法
導航與栏目结构
把需要被收錄的頁面類型放進主導航、栏目頁或聚合頁,让它們至少有一個人人可见的入口。层級不宜過深,但也不必為了压平把全站連結塞進首頁。
列表頁與推荐位
- 列表頁保持稳定的翻頁逻辑,让翻頁連結可被正常抓取;
- 詳情頁底部放相關推荐、同栏目最新几條,形成横向連結;
- 新增内容在栏目頁、首頁或专题頁露一次面,通常比干等 sitemap 更有用。
面包屑與站点地图頁
面包屑提供了回到上一层的路径,也让蜘蛛更容易理解层級關系。一個 HTML 版的站点地图頁(不是 XML sitemap)可以作為兜底入口,集中列出主要栏目和重要頁面。
孤儿頁面和只靠 sitemap 的頁面
這類頁面在站内没有任何連結指向,蜘蛛只能通過 sitemap 或外鏈知道它的存在。它們不一定收錄不了,但抓取往往更慢、更不稳定,更新後重新被抓取的間隔也更長。如果頁面本身有收錄價值,建议至少给它一個站内入口。
自查的顺序
- 挑几個希望被收錄的頁面,手動從首頁數一數要点几次才能到達;
- 確認這些頁面是否真有站内連結指向,可用抓取工具或站内搜尋核對;
- 看服務器日誌中這些 URL 的抓取记錄,判断是否長期没有蜘蛛訪問;
- 检查連結是否被 nofollow、是否依赖 JS 渲染後才出現、是否被 robots.txt 挡住;
- 確認頁面自身没有 noindex,返回狀態碼正常。
几個常见誤区
- 越扁平越好:把几十上百個連結堆到首頁,既稀释權重,也不利于用戶查找;
- 連結多就等于收錄快:無意义的互鏈、頁脚堆連結,實际作用有限,還可能被判為過度優化;
- 提交了 sitemap 就等收錄:sitemap 解决的是發現,抓取和收錄還取决于頁面质量與站点整体表現。
内鏈深度不是唯一變量,但它是一個自己就能控制、改完較快能看到變化的因素。先把重要頁面的入口理顺,再去看内容质量和重复内容問题,排查顺序會清楚很多。