先把“被發現”和“被收錄”分開
很多站点在上线新頁面後做的第一件事,是去外面發一批連結,然後盯着索引量看有没有涨。這個動作本身没問题,但预期容易错位。外鏈最确定的作用是让爬虫知道這個 URL 存在,它属于發現环节。至于爬虫什么时候来抓、抓完之後收不收,取决于站点整体的抓取情况、頁面本身的质量和重复程度,這些都不是一條外鏈能决定的。
把這两件事分開之後,核對起来會清楚很多:發現出問题,就查入口;收錄出問题,就查頁面和站点信号。
四條常见的 URL 發現路径
站内連結
從首頁或栏目頁能点到的連結,是最稳定的一條路径。它的特点是可持續——只要頁面在導航或列表里,爬虫每次来訪都可能重新经過。点击深度越深、入口越少的頁面,被發現的時間越不确定。
XML Sitemap
Sitemap 提供的是批量入口,适合新頁面集中上线的情况。它的作用是告知,不是强制抓取。提交之後仍然要看日誌里爬虫有没有實际訪問。
外部連結與社交分享
外部頁面上的連結,相当于给爬虫留了一條站外入口。對于還没有任何内鏈指向的新 URL,這往往是它第一次被訪問的原因。社交平台上的分享效果不稳定,更适合当作辅助。
手動提交與接口推送
部分搜尋引擎提供單條 URL 提交或接口推送,适合少量、时效性强的頁面。它同样只解决發現环节。
外鏈在發現环节里扮演什么角色
一個可被抓取的外鏈,價值主要在两点:一是让爬虫第一次遇到這個 URL,二是如果連結所在頁面本身抓取频繁,爬虫经過的次數也會更多。這两点都停留在“更容易被看到”的层面。
常被混淆的是 nofollow。带 nofollow 的外鏈通常仍然可以作為發現入口,只是不传递權重。所以看到一個 nofollow 連結就認為“完全没用”,並不准确;反過来,認為發了一條外鏈頁面就一定會被收錄,也不成立。
從日誌到索引狀態的核對顺序
- 日誌里有没有爬虫訪問记錄。先確認目标 URL 是否真的被請求過,以及請求来自哪條路径。
- 首次訪問時間與後續重訪。只有一次訪問,說明只完成了發現;有稳定重訪,說明這個 URL 已经被纳入抓取范围。
- 响應狀態與返回内容。確認返回的是 200、内容是否完整、有没有被 robots.txt 挡住,或者被跳轉鏈消耗掉。
- 搜尋侧核對索引狀態。用站点查询或索引工具確認這個 URL 目前是否在索引里,注意区分“已抓取”和“已收錄”。
- 看站内上下文。如果頁面始终不收錄,检查它有没有内鏈入口、和站内其他頁面是否高度相似。
几個容易踩的坑
- 短時間集中發大量外鏈。入口數量突然暴涨,對發現环节没有額外帮助,反而可能带来一批低质連結。
- 外鏈指向的 URL 自己有問题。目标頁返回 301、404,或者需要登入才能看到内容,爬虫到了也拿不到有效頁面。
- 連結所在頁面本身不被抓取。如果外鏈所在的頁面長期不被訪問,這條入口等于不存在。
- 把外鏈当成收錄手段。内容重复、模板占比過高、缺少站内入口的頁面,發再多連結也很难稳定進入索引。
外鏈解决的是“爬虫知不知道這個 URL”,不解决“這個 URL 值不值得被收錄”。两件事的排查方向不同,混在一起看容易得出错誤结论。
更實际的做法
如果目标是让新頁面尽快進入抓取范围,優先顺序通常是:先保證站内有清晰入口,再提交 Sitemap,然後才考虑外部的發現入口。外鏈可以锦上添花,但不该是唯一依赖。
上线一段時間後,用同一批頁面做對比會更有參考價值:把有内鏈入口的和没有的、有外鏈的和没有的分成两组,對照日誌里的抓取時間和索引狀態。差异出現的地方,往往就是需要優先补的环节。