不少站点遇到過這種情况:日誌里天天有蜘蛛来抓,URL 也没有被 robots 挡住,可過了一两個月,索引里依然找不到這些頁面。抓取和收錄本来就是两個环节——蜘蛛把 URL 取回去只是第一步,搜尋引擎還要判断這個頁面值不值得留在索引里。当抓取正常、收錄却不理想时,與其反复提交地址,不如把頁面质量的相關维度按顺序過一遍。
先確認問题出在哪一环
排查前先做個简單区分,避免把方向搞反:
- 抓取层面:狀態碼是否 200、是否被 robots 或 noindex 拦下、返回内容是否正常(不是空壳或错誤頁)。
- 收錄层面:頁面能打開、能被抓,但索引里始终没有,或者出現過又被移除。
- 归並层面:頁面進了索引,但入口是另一個 URL,本站地址只是它的重复版本。
如果第一层就有問题,後面讨论质量没有意义。確認前一层没問题之後,再往下看内容本身。
维度一:内容是否完整、能獨立成頁
搜尋引擎對一個頁面最基本的判断是:它作為獨立结果呈現时,能否回答一個問题。常见的“不够完整”有几類:
- 正文只有一两句话,其余全是導航、推荐位和广告位。
- 關键信息藏在图片里、表格里或需要交互才能展開,源碼中几乎没有對應文字。
- 标题、简介、正文之間明顯拼接,段落之間逻辑断裂。
- 頁面主体依赖上一頁的上下文才看得懂,單獨打開信息不成立。
這類頁面未必會被判為违規,但優先級自然靠後。可以先從站内挑出二三十個收錄不理想的样本,看看它們是否普遍存在上述特征,再决定是补内容還是做整合。
维度二:站内是否存在多份近似内容
重复内容不一定是全站複製,更常见的是同一份信息被拆成多個 URL:
- 带與不带结尾斜杠、大小寫不同的路径;
- 带跟踪參數、排序參數、篩選參數的地址;
- 正文相同但模板、栏目、面包屑不同的頁面;
- 同一商品或文章同时挂在多個分類下。
處理思路是让它們收敛到同一個規范地址:能 301 的做 301,能通過 canonical 声明主版本的声明清楚,參數頁尽量不生成新地址。這里的關键是先统一 URL 寫法,再谈内容质量,否則同一份内容會被反复当成新頁面评估。
维度三:站内上下文是否给了足够信号
一個頁面被不被重视,站内連結是能传递信号的。核對时可以看几個点:
- 這個頁面從首頁出發,需要点击几次才能到達;
- 是否有来自相關内容的正文内鏈,而不只是導航和列表;
- 連結锚文本是否和頁面主题相關,而不是“点击這里”“查看更多”;
- 頁面自身是否向外連結到相關頁面,形成可繼續浏览的路径。
孤立的頁面、只能從站点地图找到的頁面,即使内容不差,被發現和被重新訪問的机會也偏少。
维度四:頁面呈現是否稳定
排版密集、彈窗遮挡、加载缓慢、正文随滚動才出現,這些都會影响對頁面主体的判定。至少保證:主要文字在首次加载的源碼中就能讀到,正文区域和導航、广告区域在结构上有明顯区分。
一個可执行的核對顺序
- 用日誌或抓取工具確認目标 URL 的返回狀態與内容是否正确。
- 確認没有被 robots、noindex、登入墙拦住。
- 检查该 URL 是否與站内其他地址重复,确定規范地址。
- 看頁面内容能否獨立成立,是否存在明顯的薄内容特征。
- 看内鏈數量、入口位置與锚文本是否合理。
- 把存在同類問题的頁面分组,按组處理,而不是逐個改。
- 改完之後记錄時間点,隔一段時間再回看索引狀態,比較處理前後的差异。
收錄是结果,不是可以直接操作的開關。把頁面本身和站内路径整理清楚,是提高被收錄概率的常規做法,但任何調整都不保證一定被收錄,也不保證具体時間。
几個容易走偏的做法
- 只盯着提交入口,反复提交同一個地址,而不检查頁面本身。
- 把大量低质頁面批量加上内鏈,指望用數量換收錄。
- 看到没收錄就立刻改标题、改正文,導致同一頁面频繁變動,反而不好判断效果。
- 只看索引總量,不看具体哪些類型頁面在收錄、哪些一直不收錄。
比較稳妥的做法是:固定一批观察样本,按分组记錄處理方式和時間,過一段時間再比對。收錄情况受内容、站内结构、竞争程度等多方面影响,能把可控的部分做扎實,就已经達到目的了。