有些頁面並不是被判定為低质量才不收錄,而是搜尋蜘蛛压根没有走到過那個地址。所以在排查收錄之前,先確認一件事:這個頁面從首頁出發,能不能通過正常連結被点到。如果答案是不能,後面讨论的内容质量、更新频率都属于次要問题。
抓取的前提是有入口
搜尋蜘蛛發現 URL 的常见来源包括:站内連結、sitemap、外部連結,以及歷史抓取记錄里残留的地址。其中站内連結的可控性最强,也最容易被忽略。一個頁面如果只存在于 sitemap 里,没有其他頁面指向它,它的抓取優先級通常較低,等待時間也會被拉長。
連結本身要可被抓取
- 連結要寫成 a 标簽的 href 属性,不要用 onclick 或者 div 模拟跳轉;
- 避免把 JavaScript 渲染後才插入的連結作為唯一入口;
- 内部連結不要加 rel="nofollow",也不要用 robots.txt 屏蔽列表頁;
- 锚文本尽量有實际含义,避免整頁都是“点击這里”。
核對顺序
- 先確認頁面有几個内鏈入口。只有 sitemap 里出現、正文中没有任何連結指向的地址,通常属于孤岛頁面。處理方式是把它接回主结构,而不是反复提交。
- 再看入口頁自己有没有被抓取。如果指向目标頁的栏目頁或列表頁長期没被抓,目标頁自然难以被發現。入口失效會连鎖传递。
- 检查点击深度。從首頁到目标頁要经過几层連結?层級越深,被抓取的频次和優先級通常越低。重要頁面尽量控制在三层以内。
- 检查列表頁的分頁與篩選。如果新頁面只出現在第十頁之後,或者只在某個篩選參數组合里出現,被發現的概率會明顯下降,可以把重要入口前置。
- 检查入口連結是否指向跳轉或屏蔽地址。入口先跳 301 再跳目标頁,鏈路越長,發現效率越低。
- 最後才看内容與更新。入口確認存在、层級合理、連結可抓取之後,再去讨论内容差异度和更新信号,顺序不要颠倒。
常见的几種入口問题
- 栏目頁用無限滚動,連結只在滚動後才生成,蜘蛛看到的是空容器;
- 新文章只在首頁短暂露出,第二天就被推到列表深處;
- 标簽頁、聚合頁數量很多,真正的内容頁却没有反向連結;
- 把站内搜尋结果頁当成入口,實际是參數型临时地址。
把頁面接進主連結结构,是提高被發現概率的常規做法,但它不等于一定被收錄。是否進入索引,仍由搜尋引擎综合判断。
可以落地的處理動作
先做一次小范围盘点:從首頁出發按点击层級顺一遍站内連結,找出没有任何頁面連結到的地址。针對這些地址,選擇相關的栏目頁或文章頁做自然的上下文連結,而不是在頁脚全站堆連結。對于确實需要長期保留、但入口偏弱的頁面,可以考虑在相關聚合頁或導航中给出固定位置。
處理完之後不要立刻反复提交,给抓取和评估留一段時間,再观察入口頁與目标頁的抓取记錄是否出現變化。如果入口已经接好、层級也合理,剩下的就更偏向内容本身和整体站点质量了。