一個頁面能不能被收錄,第一步往往不是内容好不好,而是它有没有被蜘蛛發現。發現、抓取、收錄是三件事:地址没進入已知列表,後面两步都無從谈起。很多站点的收錄問题追到源头,其實是 URL 發現這條路径断了。
蜘蛛發現 URL 的几條路径
搜尋引擎長期维護着一張已知 URL 的图,新地址進入這張图主要靠几個入口:
- 已抓取頁面里的連結:最主要的来源。蜘蛛抓完一頁,會顺着源碼里的 a 标簽繼續走。
- sitemap:适合补充内鏈覆盖不到的地址,但它更像一份清單,不保證按清單逐條抓取。
- 外部連結:其他站点鏈過来,同样會把地址带進索引体系。
- 站内其他信号:重定向、canonical、hreflang 指向的新地址,也可能被顺带發現。
其中内鏈是唯一由你完全掌控、又能持續發挥作用的入口。sitemap 提交之後長時間没動静,原因多半就在這里:入口是有了,優先級和上下文却不够。
哪些頁面容易變成孤岛
孤岛頁指站内没有任何或只有极少數連結指向它的頁面。常见成因包括:
- 導航和列表由 JS 動態渲染,源碼里没有可点的 a 标簽。
- 文章頁只從最新發布或時間归档里出現,過一段時間就被挤出列表。
- 詳情頁藏在搜尋结果頁、篩選结果頁或表單提交後的頁面里。
- 栏目分頁被设成 noindex 或不輸出連結,深层頁面失去通道。
- 連結指向的是重定向鏈的起点,绕過几跳之後蜘蛛放弃繼續跟。
- 内鏈带了 nofollow,或者寫在按钮和 div 的点击事件上。
這類頁面在後台看是正常發布,在索引侧看却像從未出現過。收錄自查时如果發現整批頁面都停在已發現、尚未抓取,可以優先怀疑入口太弱,而不是先怀疑服務器。
怎么確認一個 URL 有没有被抓取入口
- 在站内搜该地址的特征關鍵詞,看是否只有 sitemap 提到它,没有任何頁面鏈它。
- 查日誌或抓取记錄,確認蜘蛛對该地址是否有過訪問請求。
- 检查頁面源碼而不是渲染後的 DOM,看是否存在指向它的 a href。
- 顺一遍從首頁到该頁的点击路径,看几跳能到。
如果一條路径都走不通,它基本就是孤岛。這时再優化頁面内部结构,也很难被走到。
补入口的几種做法
- 加上下文内鏈:從主题相關的栏目頁或文章正文里,用一两句话自然指向它,比在頁脚堆一堆連結更有效。
- 打通聚合頁:為同類頁面建一個可被連結的分類頁或专题頁,让一批頁面共享同一個入口。
- 补面包屑和相關推荐:位置固定、輸出稳定,适合長期托底。
- 同步更新 sitemap:作為补充清單,與内鏈一起提交,不要只依赖它。
- 控制层級深度:重要頁面尽量在三到四次点击内可達,层級越深,被走到的概率越低。
別把补連結做成連結农场
大量無差別、全站铺開的互鏈容易被判定為操纵行為,對收錄没有正向作用。有效的补鏈是少量、相關、有上下文:連結文字和落点内容對得上,用戶点過去也愿意看。另一個常见誤区是把連結都塞進頁脚或侧邊栏,這些区域重复度高,能传递的信号有限。
URL 發現是收錄鏈路的第一环。與其反复提交、反复催收錄,不如先確認目标頁面在站内至少有一條来自正文的自然連結,並且這條連結在頁面源碼里真的存在。