做收錄相關的工作,很多人第一反應是看索引量、看抓取频次,但更靠前的一步常被忽略:蜘蛛得先知道這個 URL 存在。發現不了,後面的抓取和收錄都無從谈起。這篇讲的是 URL 發現路径,也就是蜘蛛是怎么在你的站里「走到」某個頁面的。
發現、抓取、收錄是三件事
發現(Discovery)指蜘蛛從某個已知地址里讀到了一條新的連結;抓取(Crawl)指它真的去請求了這個地址;收錄(Indexing)指抓取回来的内容经過處理進入了索引。三者是串联的,任何一环断掉,頁面都不會出現在索引结果里。
所以当頁面迟迟没有被收錄时,先別急着改正文。可以先問一個問题:這個 URL,除了你手動提交,還有別的入口能通向它吗?
蜘蛛常用的几條發現路径
- 站内連結:最主要的来源,蜘蛛沿着 a 标簽的 href 一路走。
- 站点地图:一份补充清單,适合新頁面、孤立頁面。
- 外部連結:其他站点的連結,尤其是首頁或高權重頁面上的。
- 提交與推送:搜尋资源平台的手動提交、API 推送等。
几條路径里,站内連結是日常最可控的一條。站点地图和提交更像是「点名」,能加快發現,但不解决頁面本身值不值得抓的問题。
内鏈深度:從首頁点几次能到
可以把整站想象成一張图,首頁是起点,連結是邊。一個 URL 离首頁越遠,被發現的概率和频率通常越低。
常见的三種「藏得太深」
- 只能通過列表頁翻到很後面才看得到,而前面的分頁又是 JS 加载。
- 入口只存在于某篇舊文章的正文里,而那篇舊文章本身没被收錄。
- 栏目頁只展示最新一批内容,歷史頁面没有任何其他入口。
可以拿几個目标 URL 反過来查:站内還有哪些頁面鏈到它?入口數量太少,或者入口本身等級太低,就需要补内鏈。
連結寫法的几個坑
- 用 onclick 跳轉或 div 冒充連結,没有 href,蜘蛛讀不到地址。
- href 是 javascript:void(0) 或 # 占位,真實地址靠 JS 拼接,往往要等渲染才能拿到。
- 内鏈上随手加 rel="nofollow",這條路對蜘蛛就無效了。
- 同一個目标指向多個不同 URL(带參數、大小寫差异),把入口權重拆散了。
内鏈不是越多越好。一個頁面被几百個不相關的連結指向,和它被几個相關頁面自然地推荐,效果完全不同。
站点地图是补充,不是替代
常见誤解是「把 URL 都寫進 sitemap 就一定會被收錄」。站点地图的作用是告诉蜘蛛這里有這些地址,它不會替頁面争取抓取预算,也不能改變頁面质量的判断。把站点地图当作兜底手段,同时把内鏈做扎實,才是合理的搭配。
一個简單的自查流程
- 挑出最近想被收錄、但狀態不理想的 URL。
- 用站内搜尋或抓取工具,查這些 URL 有多少内鏈入口。
- 检查入口連結是否為可抓取的 a href,是否被 nofollow 或 robots 阻断。
- 確認從首頁到该 URL 需要点击几次,层級是否過深。
- 按需补入口:相關文章推荐、栏目列表、专题聚合頁。
- 過一两周再观察抓取與索引狀態的變化,不要当天就下结论。
小结
收錄問题的排查顺序,建议從「能不能被發現」開始,再到「蜘蛛愿不愿意抓」,最後才是「内容质量够不够」。内鏈结构是這條鏈條里最容易控制、也最容易被忽略的一环。把入口理顺,不少頁面的收錄情况會跟着松動。