新頁面迟迟不進索引,很多人第一反應是内容质量或權重問题,但排查下来,卡住的位置常常更靠前——搜尋引擎压根還没發現這個 URL。抓取和索引都發生在發現之後,發現入口没铺好,後面的優化動作都無從谈起。
URL 發現是收錄鏈條的第一环
搜尋引擎處理一個頁面大致分三步:發現 URL、抓取頁面、判断是否值得進索引。三者是递進關系,前一步没完成,後一步不會凭空發生。sitemap 只是發現入口之一,不是唯一入口,也不是提交了就一定會被處理。
常见的 URL 發現入口
站内連結
最稳定、最不需要額外维護的入口是站内連結。新頁面只要被一個已被频繁抓取的頁面連結到,就有机會進入待抓队列。常见問题是新頁面只挂在深层列表頁,或者連結只存在于 JS 渲染後才出現的区域,蜘蛛顺着 HTML 走不到。
- 在栏目頁、相關推荐、上一篇/下一篇等固定位置给出連結,比临时插入更可靠;
- 避免整站靠 JS 生成導航連結,HTML 里至少要有一份可点击的路径;
- 给重要新頁找一個层級較浅的入口,別让它只能從三层以下的列表頁進入。
sitemap 與站長平台提交
sitemap 的價值在于批量告知,适合新增量大、更新频繁的站点。要注意两点:只放狀態正常的 200 頁面,lastmod 尽量寫真實更新時間;sitemap 本身要能被抓到,且不要放在 robots.txt 禁止的目錄下。站長平台的單個 URL 提交适合應急,不适合当日常主渠道。
外鏈與外部提及
站外連結是發現新域名、新栏目最直接的途径之一。有條件时,新栏目上线後可以從相關站点、行业社区或合作方拿到自然提及。連結是否加 nofollow 影响的是權重传递,並不代表完全不參與發現。
其他入口
RSS 或 Atom 订阅、更新频率稳定的栏目、頁面之間的互鏈,都會形成額外的發現路径。對更新密集的站点,保持一個结构清晰的“最新”入口,通常比指望蜘蛛定时回訪更實在。
發現、抓取、收錄是三件事
URL 被發現,只代表進了候選队列;能不能被排上抓取、抓完是否進索引,還要看抓取预算、頁面狀態和内容判断。排查时不要用“没收錄”這一個结论,替代對三段狀態的分別確認。
頁面長期没動静时,按顺序看這几点
- 站内是否已有可抓取的 HTML 連結指向它;
- robots.txt、meta robots、頁面狀態碼是否挡住了抓取或索引;
- URL 是否带一堆參數、大小寫混乱,導致同一頁面分散成多條地址;
- 是否處在孤岛狀態,除了 sitemap 之外没有任何站内入口;
- 服務器响應是否稳定,是否存在批量超时或 5xx 记錄。
容易被忽略的细节
- 新 URL 不要只寫進 sitemap 就等着,同时给站内入口,两條路径叠加起来更稳;
- 列表頁數量要克制,大量低價值列表和新頁抢抓取机會,反而拖慢重要頁面;
- 參數尽量收敛,跟踪參數、排序參數過多,會让同一内容衍生出很多地址;
- 定期看服務器日誌,能直观看出蜘蛛是否真的来過、来的是哪個版本的地址。
小结
收錄問题從發現环节查起,往往比反复改内容更快找到症结。把站内連結、sitemap、外部提及這几條發現路径铺顺,再去看抓取與索引的具体表現,判断會清晰很多。任何入口都只是提高被發現的概率,最终是否進索引仍由搜尋引擎决定。