新頁面提交後迟迟没有動静,很多人第一反應是“再提交一次”。但搜尋蜘蛛發現 URL 的主要途径是連結,而不是提交動作。如果站点里没有任何一條可抓取的連結指向它,這個頁面在發現阶段就已经卡住了。核對收錄問题时,先量一量從首頁到目标頁的点击距离,往往比反复提交更有用。
發現、抓取、收錄是三件事
發現是搜尋引擎知道這個 URL 存在;抓取是蜘蛛真正来取了一次;收錄是頁面進入索引並可被检索。三者顺序固定,卡在任何一段,後面的動作都不會發生。提交 sitemap、手動提交 URL 能帮助發現,但它們只是入口之一,且不能保證蜘蛛會沿着這個入口繼續走。
先看目标頁有没有“真實可点”的内鏈
打開首頁或几個主要栏目頁,用最朴素的方式检查:不看源碼,直接用鼠标能不能点到這個頁面。這一步能排掉很多假入口。
- 連結由脚本在点击後才生成,HTML 里根本没有 href。
- 連結在需要登入、選擇地区或展開菜單後才出現。
- 站内連結被加了 nofollow 或改成 onclick 跳轉,蜘蛛不會顺着走。
- 連結只在 sitemap 里出現,頁面上找不到一處入口。
再量点击距离
從首頁出發,數一下到目标頁需要点几次。栏目頁、詳情頁通常在两到四次点击内比較常见;如果需要经過多层篩選、翻很多頁分頁,或者绕一大圈才到達,蜘蛛走到這里的概率就會明顯下降。
可以按模板抽样,各挑几個頁面,记錄它們的入口路径:從哪個頁面能点到,中間隔了几层。如果同一模板的頁面入口都藏在很深處,問题多半在结构上,而不是單個頁面。
常见的深度来源
- 列表頁只展示最新的一批,老頁面要靠不断翻頁才能看到。
- 篩選、排序组合出的列表頁成了唯一入口。
- 相關内容模块只推荐同類热门頁,新頁面長期不在推荐池里。
- 頁面只在搜尋结果、站内搜尋或用戶中心等需要交互的位置出現。
按顺序核對
- 確認頁面狀態正常,返回 200,没有被 robots.txt 拦截,也没有 noindex。
- 找到至少一個静態可点的入口,检查是否為普通 a 标簽。
- 從首頁數点击距离,记錄路径层數。
- 看该模板其他頁面的入口情况,判断是個例還是结构問题。
- 看服務器日誌里蜘蛛最近一次到訪是什么时候,命中的是哪個 URL。
- 再决定是加内鏈、調整栏目结构,還是僅通過 sitemap 补充。
加内鏈时注意什么
补内鏈的目标是让路径真實可用,而不是堆數量。可以優先把新頁面放進栏目列表、上一級頁面的相關推荐,以及同主题頁面之間的互鏈。連結文字尽量能說明頁面内容,避免清一色的“点击查看”“更多”。
内鏈是给用戶走的,也是给蜘蛛走的。用戶点不到的地方,蜘蛛通常也走不到;即使偶尔走到了,頁面缺少稳定的外部指向,後續更新也很难被重新發現。
最後提醒一点:連結調整後不要指望立刻见效。蜘蛛重新規划爬行路径需要時間,观察周期按周来算更稳妥。期間可以繼續用日誌確認入口是否被走到,而不是反复提交同一個 URL。