很多站点的問题不是頁面寫得不够好,而是蜘蛛根本走不到那個頁面。站内 URL 的可達性,是發現和抓取的前置條件,而可達性主要由内鏈决定。站点地图和主動提交能帮上忙,但它們更像是补充通道,不是主路。
蜘蛛發現新 URL 的几條路径
從優先級上看,搜尋引擎拿到一個新地址,通常依次来自這几個地方:
- 站内連結跳轉:從已抓取頁面顺着 a 标簽 href 走出来,這是最主要、也最稳定的入口;
- 站点地图:作為补充,帮助確認站点结构,但不保證每條都被抓;
- 外部連結:其他站点指向你的連結,尤其是權重較高的来源;
- 手動提交:可以在一定程度上加快發現,但决定不了後續结果;
- 歷史记錄:之前被抓過的地址,會被重新排期。
可以看出,除了外鏈和提交,剩下的都依赖站内结构。如果内鏈本身断了,頁面就只剩站点地图這一條细线。
什么是“孤儿頁面”
孤儿頁面指的是站内没有任何連結指向、或者指向路径藏得很深的 URL。常见表現有几種:
- 頁面上只能通過搜尋框輸入關鍵詞才能到達;
- 連結由 JavaScript 在交互後才生成,初始 HTML 里看不到;
- 只在 XML 站点地图里出現,正文中没有任何入口;
- 被放在需要连續点击五六层才能到達的位置;
- 由篩選參數、排序參數動態拼出来的地址。
這些頁面不一定是低质量内容,但對蜘蛛来说,它們缺少“被引荐”的信号,自然容易排在队列後面。
内鏈影响的不只是發現
内鏈的作用通常被简化成“让蜘蛛爬過来”,其實還有两层:
- 上下文:連結周围的文字和锚文本,會影响搜尋引擎對這個頁面主题的理解;
- 重要程度:一個頁面被多少入口指向、入口本身有多重要,會影响它的抓取频率和更新节奏。
所以内鏈調整不只是技術活,也涉及内容组织方式。
自查:把被埋住的頁面找出来
- 用抓取工具跑一遍全站,導出一份内鏈图谱,标出没有入鏈的 URL;
- 把站点地图里的地址和内鏈集合做差集,差集里的通常就是孤儿頁面;
- 翻服務器日誌,看哪些頁面長期没有蜘蛛訪問记錄;
- 检查導航、面包屑、分類頁和相關推荐,確認關键栏目都有人口;
- 按目錄分组統計,看看問题集中在哪一類頁面上。
做完這几步,通常會發現問题集中在某個栏目或某種模板上,而不是全站均匀分布。
几個常见的判断誤区
連結寫在 JavaScript 里就一定生效
如果連結是点击後才由脚本插入的,或者只是给 div 绑定了点击事件而没有真正的 a 标簽 href,那么渲染之前它並不算一條連結。尽量保證關键入口出現在初始 HTML 中。
只要放進站点地图就够了
站点地图能帮助確認地址存在,但它代替不了内鏈带来的上下文和重要度信号。两者是互补關系。
連結越多越好
在頁脚堆几百個全站連結,或者在正文里塞入大量無關連結,反而會稀释每條連結传递的信号,也不利于用戶阅讀。
調整内鏈时的几個做法
- 從主题相關的正文里加自然連結,而不是只在導航里补一條;
- 给成系列的内容做一個聚合入口頁,让深层文章有稳定的上游;
- 控制点击深度,重要内容尽量在三次点击内到達;
- 清理死鏈和指向已下架頁面的連結,避免把蜘蛛引向空地址;
- 检查 nofollow 的使用,別把本该被發現的入口挡掉;
- 分批修改,改完观察一段時間日誌,確認蜘蛛确實走到了新入口。
内鏈解决的是“能不能被發現”,收錄與否還要看内容质量、頁面狀態和抓取排期,這两件事不要混為一谈。
把内鏈理顺,往往比反复提交 URL 更有效。它不需要額外申請什么,只需要在内容组织上多花一点心思,让每個值得被收錄的頁面,至少有一條清晰的入口。