不少站点把收錄慢归结為提交不够、蜘蛛不来,但在訪問日誌里往往能看到更朴素的原因:目标頁面没有一條稳定、可见的站内入口連結。抓取是沿着連結走的,連結出現在哪里、出現几次、是否在渲染前就存在,直接决定了 URL 被發現的顺序和频率。
蜘蛛先看到連結,再看到頁面
大致流程是:爬虫從已知地址出發,解析頁面里的連結,把新 URL 放進待抓取队列,再按队列安排訪問。也就是说,一個頁面在被抓取之前,必须先有人给它指路,而這個指路動作通常就是連結。完全没有連結的頁面,只能依赖站点地图、外部連結或歷史抓取记錄被發現,路径要脆弱得多。
不同位置的連結,作用不一样
- 主導航:全站可见,通常被優先抓取,适合承载频道頁和核心栏目。
- 面包屑:体現层級關系,帮助爬虫理解頁面在站点中的位置。
- 列表頁與聚合頁:新内容最常见的發現入口,列表更新频率往往决定新頁面的發現速度。
- 正文内鏈:上下文相關,指向的多為同類内容,有助于主题聚類。
- 頁脚:全站重复出現,價值有限,适合放政策與帮助類頁面,不适合塞進大量文章連結。
- 站点地图:适合补充那些自然連結很少、但希望被抓取的 URL,但它不能替代内鏈。
哪些頁面容易變成孤岛
- 只存在于站内搜尋或篩選结果中的頁面,入口藏在參數後面。
- 需要点击後才由脚本生成的連結,渲染前的 HTML 中並不存在可抓取的地址。
- 分頁很深的商品頁或文章頁,要翻到很多頁之後才有第一條入口。
- 活動专题下线後撤掉了導航入口,連結只剩在早期推送里。
- 新站一次性上线大量頁面,除了站点地图,没有任何站内通路。
一份可执行的調整顺序
- 先确定真正希望被收錄的 URL 清單,數量控制在能長期维護的范围内。
- 逐個检查這些 URL 是否至少有一條来自站内的稳定連結,並且不依赖脚本渲染才出現。
- 把核心頁面放進主導航或一級列表頁,長尾頁面放進與主题相關的聚合頁。
- 精简頁脚和侧栏的全站重复連結,把有限的連結位置留给需要被發現的頁面。
- 让關键列表頁保持更新,新内容發布时就同步获得入口。
- 用站点地图覆盖确實没有自然入口的 URL,同时優先补齐内鏈缺失的問题。
怎么核對調整是否生效
改完之後不要只盯着收錄數量,先看抓取日誌:目标 URL 有没有被訪問、来源頁是哪一個、訪問频率有没有變化。再對照索引狀態,观察是否從“已發現,尚未编入索引”逐步轉向被索引。這個過程通常以天到周計,不同站点差別很大,不宜按天催促。
内鏈只解决“能不能被發現”,並不保證被收錄。頁面质量、重复程度和站点整体情况,仍然决定索引最终是否采纳。
需要留意的邊界
内鏈優化不是把連結堆满頁面。一個頁面上連結過多,會稀释每條連結被跟随的机會,也让頁面结构變得杂乱。比起數量,更值得關注的是:重要頁面是否拥有稳定、语义清晰的入口,並且這些入口在頁面最初返回的 HTML 里就能被看到。