站点收录率只是一个统计结果,真正被判断的对象是每一个 URL。同一个目录下,有的页面很快进索引,有的抓过几次就没了下文,差别通常不在运气,而在页面本身能提供多少可用信息。下面这几项,是把一个页面单独拿出来时比较常被关注的方面。
一、正文主体能不能被直接取到
处理一个页面时,先要拿到它的主要内容。如果正文只存在于交互之后,比如点开标签、滚动加载、点击展开全文才出现,首屏 HTML 里只有框架和占位文字,那么这个 URL 可被判断的信息就非常有限。
- 正文写在 HTML 里,还是等脚本请求回来才出现;
- 有没有全屏弹窗、浮层、跳转页挡住主体内容;
- 同一段正文是否被推荐位、相关阅读、评论切成很多碎片,导致主次不清。
不需要刻意做特殊版本,但要保证在不执行脚本的情况下,页面的核心信息仍能读出一个大概。
二、内容是否唯一,主题是否清楚
模板相同不代表内容重复,但如果正文部分高度相似,页面之间就很难被区分对待。常见情形有几类:
- 列表页、筛选页只有排序不同,条目完全一致;
- 商品或文章正文直接沿用来源站的描述,站内多个 URL 内容雷同;
- 页面大部分是导航、广告、推荐,真正的正文只有一两句话。
主题清楚,是指从标题、H1、首段就能判断这个页面在讲什么。若一页里塞了三四个不相关的主题,或者标题里堆了一串关键词,页面就很难获得一个明确的定位。
三、有没有稳定、可预期的入口
入口影响的不只是能否被发现,也影响这个 URL 在站内是否被当作正式内容:
- 是否有站内链接指向它,而不是只靠 sitemap 或提交接口;
- 链接出现在导航、栏目页,还是页脚一长串链接里;
- 链接指向的 URL 与 canonical、实际访问的 URL 是否一致。
如果站内没有任何链接指向某页,或者链接文字长期是「点击这里」「更多」,这类页面被当成独立内容处理的机会会小很多。
四、技术层面的可用性
这一层不是加分项,而是门槛:
- 返回稳定的 200,不频繁出现 5xx、超时、限流;
- 不要求登录、验证码或特定地区才能看到内容;
- canonical、robots、分页关系之间不互相矛盾;
- 移动端能正常阅读,不做强制跳转或大面积遮挡。
收录是结果,不是可以单独优化的动作。页面能不能被收录,多数时候取决于它本身是否值得被单独拿出来。
五、按顺序自查单个页面
与其盯着总收录数,不如抽几个典型 URL 逐项核对:
- 禁用脚本打开页面,看还剩多少正文;
- 把页面文字复制出来,看有多少是自己独有的内容;
- 用站内搜索或链接检查工具,确认它是否被内链指向;
- 看服务器日志里这个 URL 的抓取频率和返回状态。
按这个顺序过一遍,大部分「为什么不收录」的疑问都能落到具体某一项上,而不是停在猜测。需要提醒的是,页面质量只是前提,最终是否进入索引、以哪个 URL 进入,仍由搜索引擎按自己的规则判断,我们能做的是把可控制的部分做扎实。