聊收錄时,大家更容易關注提交接口、sitemap 和 robots.txt,却常常忽略一件更基础的事:蜘蛛在站内活動,主要靠連結一跳一跳地走。哪里被連結,哪里就可能被抓;哪里没有連結,哪里就只剩下提交或外鏈這一條路。
内鏈不是優化清單里的装饰項,它是蜘蛛發現 URL 的主干道。把這條道梳理清楚,比反复提交更有實际意义。
入口數量:一個頁面被多少地方指向
同一個頁面,如果只在角落出現過一次,和出現在導航、列表頁、相關推荐里,被訪問的机會並不相同。入口數量多,意味着蜘蛛在站内游走时更容易反复遇到它,重新抓取的机會也更多。
需要注意的是,入口不是越多越好,也不是無脑堆連結。判断标准可以粗一点:重要頁面應当被多個不同层級的頁面連結到,並且連結出現在内容区域而不是装饰区域。
入口质量的几個观察点
- 是否来自首頁或频道頁這類常被抓取的頁面
- 是否出現在正文相關位置,而不是全站頁脚的一長串連結里
- 是否稳定存在,不随栏目改版频繁消失
层級深度:從首頁点几次能到
站内层級越深,蜘蛛越难走到。常见的经驗是,重要内容最好能在首頁点击三到四次内到達;超過這個深度,頁面就要依赖其他入口来补。
深层次的問题往往不是没有連結,而是連結鏈條太長:首頁到栏目,再到子栏目、列表、分頁、詳情。分頁本身還可能被限制抓取,頁面就此断在半路。
一個頁面被收錄得很慢,先別急着加提交,先看看從首頁点到它需要几次点击。
可以做的調整
- 把核心頁面挂到频道首頁或专题頁,缩短点击路径
- 在正文里做相關性連結,让深层頁面從内容层被引到
- 检查列表頁分頁是否把尾部内容挡住了
孤岛頁面:只在 sitemap 里,站内没人提
有些頁面在 sitemap 里有,在後台也有,但站内没有任何連結指向它。這種頁面通常依赖 sitemap 或外鏈被發現,抓取频率很低,更新也不容易被察觉。
孤岛頁面不一定是错的——活動頁、专题頁、临时推廣頁可能本就希望走提交這條路。但如果它是站点的常規内容,長期没有内鏈,就值得补一個入口。
怎么找
- 把 sitemap 里的 URL 與站内可抓取連結做一次比對,取差集
- 統計每個 URL 的站内入鏈數量,标记為 0 的记錄
- 抽查這些頁面的訪問日誌,看蜘蛛是否長期缺席
連結本身要能被抓到
連結存在,不代表蜘蛛能顺着走。以下几種情况會让内鏈形同虚设:
- 用 onclick 或 JS 跳轉代替普通連結,脚本不执行时連結不可见
- 連結被 nofollow 包住,虽然仍可能被發現,但传递的信任度下降
- 連結指向跳轉地址或中間頁,最终 URL 與頁面對不上
- 導航由前端异步渲染,蜘蛛首次抓取时拿到的是空容器
站内連結尽量用普通的 a 标簽加目标 URL,是最省事的做法。如果必须動態渲染,至少保證關键入口在 HTML 里就存在。
锚文本與相關性
锚文本能帮助理解目标頁面的主题,但它不是一個可以靠堆關鍵詞来操控的開關。用頁面本身的标题或核心内容做锚文本,比统一用“点击這里”更清楚,也更自然。
一份简單的自查顺序
- 整理站点希望被收錄的 URL 清單
- 用抓取工具或日誌,統計這些 URL 的站内入鏈數量與来源层級
- 挑出入鏈為 0、或只来自全站頁脚的頁面
- 检查關键路径上是否存在 JS 連結、nofollow 與跳轉地址
- 按重要性排序,先补核心内容,再處理長尾頁面
- 調整後观察抓取日誌中這些 URL 的出現频率是否變化
内鏈梳理不會立刻让頁面進入索引,它改變的是蜘蛛在站内的行走路线。路线通畅了,頁面被發現和重新抓取的机會才會随之改變,剩下的仍需看頁面本身是否值得保留。