網站收錄

内鏈深度與锚文本:URL 被發現的路径怎样影响收錄节奏

内鏈决定了一個 URL 被發現的路径:点几下能到、從哪些頁面鏈過去、連結文字寫了什么,都會影响爬虫遇到它、並反复回訪它的概率。本文拆解連結深度、锚文本寫法與全站連結的副作用,並附一份可落地的内鏈自查清單。

網站收錄

内鏈深度與锚文本:URL 被發現的路径怎样影响收錄节奏

先分清發現、抓取和收錄

搜尋引擎處理一個 URL,大致要经過三步:先通過某種路径發現它,再安排爬虫去抓取它,最後判断内容是否值得進入索引。内鏈主要影响的是第一步,並且會持續影响後續的回訪频率。常见的情况是:頁面並没有被屏蔽,服務器也正常,只是長期没人鏈過去,爬虫就很难稳定地遇到它。

外鏈、sitemap、日誌回捞都能带来發現机會,但内鏈是站内最可控的一环。它不需要等別人给連結,改動当天就能生效。

連結深度:從首頁点几下能到

連結深度指的是從首頁出發,最少点几次能到達某個頁面。深度越浅,頁面被爬虫顺路訪問的次數通常越多;越深,就越依赖上一級頁面是否被抓取、是否更新。

深度多少算合适

  • 重要栏目和核心頁面,尽量控制在三次点击之内。
  • 真正有獨立價值的詳情頁,四到五次点击通常還能接受。
  • 如果必须点七八次才能到達,且没有其他入口,這類頁面被漏掉的概率會明顯上升。

检查深度不要只凭感觉。可以用站内搜尋、爬虫工具抓一遍連結结构,或者從服務器日誌里挑几天資料,看爬虫實际訪問了哪些层級、哪些目錄長期没有足迹。日誌反映的是真實抓取情况,比结构图更可靠。

锚文本:連結文字也在說明頁面主题

锚文本是連結的可点击文字。它一方面告诉用戶点下去會看到什么,另一方面也向搜尋引擎提示目标頁面的内容方向。

常见的問题寫法包括:全站统一使用“点击這里”“了解更多”“詳情”,或者把連結挂在纯图片、图标、按钮脚本上,導致没有可讀文字。還有一種情况是同一批頁面互相鏈来鏈去,只用“上一頁”“下一頁”這類無差別文字,目标頁面之間很难被区分開。

更實用的做法是让連結文字简短描述目标頁的主题,同一目标頁在不同位置可以略有變化,但不要為了堆词把它寫成一句完整的關鍵詞長句。锚文本自然、多样、能讀通,比整齐划一更有價值。

全站連結是把双刃剑

導航、侧栏和頁脚的連結出現在每一個頁面上,發現效率很高,但數量一旦失控,副作用也很直接。

  • 頁脚堆几十上百條連結,會让每個頁面都“指向所有地方”,重点反而不突出。
  • 把大量低價值頁面塞進全站導航,會持續消耗抓取资源。
  • 全站連結指向的頁面若经常變動,容易让爬虫反复回訪無實质變化的 URL。

比較稳妥的做法是:導航保留主要栏目,頁脚只留少量必要入口,其余頁面靠正文内的相關内容連結去被發現。重要頁面可以從多個相關頁面自然地被鏈到,而不是靠全站铺開。

新頁面上线後,内鏈可以這样铺

  1. 在所属栏目列表或聚合頁里给出入口,确保它至少有一條稳定路径。
  2. 從两三篇主题相近的舊文章正文里加一條指向它的連結。
  3. 如果頁面属于系列内容,补齐前後篇互鏈。
  4. 確認新連結不是通過脚本渲染後才出現,避免抓取时看不到。
  5. 過几天看日誌,確認爬虫是否已经訪問過该 URL。

一份内鏈自查清單

  1. 核心頁面是否能從首頁三次点击内到達。
  2. 是否存在完全没有内鏈入口的頁面。
  3. 是否有大量頁面只靠“更多”“詳情”這類通用锚文本被連結。
  4. 導航和頁脚的連結數量是否過于庞大。
  5. 内鏈指向的 URL 是否與 canonical 声明一致,有無跳轉鏈、參數鏈混用。
  6. 日誌里是否有重要目錄長期没有抓取记錄。
内鏈能改善的是“被發現”和“被反复訪問”的條件,它不保證一定被抓取,也不保證一定被收錄。把連結结构理顺、让重要頁面有清晰入口,是运营中相對确定、成本也較低的一步。