很多人盯着索引覆盖报表里的“已發現但未抓取”,其實在抓取之前還有更前面的一步:蜘蛛根本不知道這個 URL 存在。站点地图提交只解决“告知”這一件事,真正决定長期發現效率的,往往是站内連結能不能把新頁面接到已有的鏈路上。
蜘蛛是怎么知道一個 URL 的
- XML 站点地图提交後被讀取的時間和频率,並不完全由我們控制;
- 已有頁面正文里的站内連結,是會被反复重新走過的入口;
- 外部連結、社交分享能带来額外线索,但不可控;
- 歷史重定向、舊版栏目頁、废弃的 RSS,也可能留下一些痕迹。
其中最能自己掌握的是第二條。它不需要等谁批准,改一次模板或加几處正文連結就能生效。
常见的“孤岛”情况
- 新頁面只在後台生成,没有任何站内連結指向它;
- 只能從首頁導航点進去,再往下就没有下一层入口;
- 只出現在“最新内容”模块里几天,掉出列表後就断了被發現的路;
- 連結寫在脚本里、点了才加载,或者被 nofollow 遮住;
- 列表頁只放出第一頁,後面的内容没有可抓取的分頁入口。
几個實用做法
- 在内容相關的老頁面里,用自然語言加一到两處連結,位置比數量更重要;
- 建专题頁或聚合頁,把同類内容集中挂在一個可抓取的列表里;
- 面包屑和栏目導航保持一致,別让同一层級的頁面散落在不同路径下;
- 分頁列表保留可抓取的 a 标簽,不要用無限滚動完全替代翻頁;
- 站点地图只放需要被發現的規范 URL,不用频繁重提交,保持最後修改時間准确即可。
内鏈的首要作用不是传递權重,而是让蜘蛛有一條稳定、可以重复走的路径。
怎么判断有没有起作用
翻服務器日誌,看新 URL 第一次被抓的時間、抓取請求带来的来源頁,比盯着收錄數字更直接。如果两三周内外部入口都来過,而站内路径一次都没出現,多半是連結没被渲染出来或者没被跟到。也可以看索引覆盖报表里的“已發現但未抓取”,數量長期堆积时,優先补内鏈,而不是反复提交站点地图。
几個容易忽略的点
- 内鏈全部指向首頁和少數几個热门頁,長尾頁面依然没有入口;
- 為了让權重“集中”而把内鏈做成 nofollow,反而断掉了發現路径;
- 改版後舊連結直接 404 且没有 301,歷史入口一次性全部失效;
- 頁面數量上千而入口只有導航,被抓的永遠是那几十個。
理顺内鏈不等于收錄,更不等于排名,但它决定了頁面有没有机會被看到。先把入口這件事做扎實,再去看抓取频次和索引狀態,很多問题的定位會清楚很多。