不少站点遇到过这种情况:日志里天天有蜘蛛来抓,URL 也没有被 robots 挡住,可过了一两个月,索引里依然找不到这些页面。抓取和收录本来就是两个环节——蜘蛛把 URL 取回去只是第一步,搜索引擎还要判断这个页面值不值得留在索引里。当抓取正常、收录却不理想时,与其反复提交地址,不如把页面质量的相关维度按顺序过一遍。
先确认问题出在哪一环
排查前先做个简单区分,避免把方向搞反:
- 抓取层面:状态码是否 200、是否被 robots 或 noindex 拦下、返回内容是否正常(不是空壳或错误页)。
- 收录层面:页面能打开、能被抓,但索引里始终没有,或者出现过又被移除。
- 归并层面:页面进了索引,但入口是另一个 URL,本站地址只是它的重复版本。
如果第一层就有问题,后面讨论质量没有意义。确认前一层没问题之后,再往下看内容本身。
维度一:内容是否完整、能独立成页
搜索引擎对一个页面最基本的判断是:它作为独立结果呈现时,能否回答一个问题。常见的“不够完整”有几类:
- 正文只有一两句话,其余全是导航、推荐位和广告位。
- 关键信息藏在图片里、表格里或需要交互才能展开,源码中几乎没有对应文字。
- 标题、简介、正文之间明显拼接,段落之间逻辑断裂。
- 页面主体依赖上一页的上下文才看得懂,单独打开信息不成立。
这类页面未必会被判为违规,但优先级自然靠后。可以先从站内挑出二三十个收录不理想的样本,看看它们是否普遍存在上述特征,再决定是补内容还是做整合。
维度二:站内是否存在多份近似内容
重复内容不一定是全站复制,更常见的是同一份信息被拆成多个 URL:
- 带与不带结尾斜杠、大小写不同的路径;
- 带跟踪参数、排序参数、筛选参数的地址;
- 正文相同但模板、栏目、面包屑不同的页面;
- 同一商品或文章同时挂在多个分类下。
处理思路是让它们收敛到同一个规范地址:能 301 的做 301,能通过 canonical 声明主版本的声明清楚,参数页尽量不生成新地址。这里的关键是先统一 URL 写法,再谈内容质量,否则同一份内容会被反复当成新页面评估。
维度三:站内上下文是否给了足够信号
一个页面被不被重视,站内链接是能传递信号的。核对时可以看几个点:
- 这个页面从首页出发,需要点击几次才能到达;
- 是否有来自相关内容的正文内链,而不只是导航和列表;
- 链接锚文本是否和页面主题相关,而不是“点击这里”“查看更多”;
- 页面自身是否向外链接到相关页面,形成可继续浏览的路径。
孤立的页面、只能从站点地图找到的页面,即使内容不差,被发现和被重新访问的机会也偏少。
维度四:页面呈现是否稳定
排版密集、弹窗遮挡、加载缓慢、正文随滚动才出现,这些都会影响对页面主体的判定。至少保证:主要文字在首次加载的源码中就能读到,正文区域和导航、广告区域在结构上有明显区分。
一个可执行的核对顺序
- 用日志或抓取工具确认目标 URL 的返回状态与内容是否正确。
- 确认没有被 robots、noindex、登录墙拦住。
- 检查该 URL 是否与站内其他地址重复,确定规范地址。
- 看页面内容能否独立成立,是否存在明显的薄内容特征。
- 看内链数量、入口位置与锚文本是否合理。
- 把存在同类问题的页面分组,按组处理,而不是逐个改。
- 改完之后记录时间点,隔一段时间再回看索引状态,比较处理前后的差异。
收录是结果,不是可以直接操作的开关。把页面本身和站内路径整理清楚,是提高被收录概率的常规做法,但任何调整都不保证一定被收录,也不保证具体时间。
几个容易走偏的做法
- 只盯着提交入口,反复提交同一个地址,而不检查页面本身。
- 把大量低质页面批量加上内链,指望用数量换收录。
- 看到没收录就立刻改标题、改正文,导致同一页面频繁变动,反而不好判断效果。
- 只看索引总量,不看具体哪些类型页面在收录、哪些一直不收录。
比较稳妥的做法是:固定一批观察样本,按分组记录处理方式和时间,过一段时间再比对。收录情况受内容、站内结构、竞争程度等多方面影响,能把可控的部分做扎实,就已经达到目的了。