有时候在搜索结果里看到的摘要很奇怪:不是页面开头的正文,而是一串导航词、栏目名、页脚说明,甚至是“点击查看更多”“版权所有”。这不一定代表搜索蜘蛛没抓这个页面——URL 检查里可能显示已经抓取、也已经编入索引。问题出在它读到的那份内容里,你真正希望被引用的那几段文字并不在其中。
摘要通常由索引里的内容生成
摘要一般是搜索系统根据索引中保存的页面内容自动截取的,不是一个可以逐字指定的字段。meta description 有时会被参考,但页面正文本身更常被当作来源。所以当正文没有进入索引内容、或者进入的比例太小,系统能挑选的只剩导航、菜单、页脚这类模板文本,结果就显得“不像这篇文章”。
正文没被读到的几种常见情况
- 关键内容以图片形式呈现,既没有可读文本,也没有替代文字。抓取端读到的是图片标签,不是图里的句子。
- 正文由前端脚本在浏览器端拼出来,而较早阶段的抓取只拿到一个空容器。渲染阶段如果没有覆盖到,索引里就是空壳。
- 首屏只有一句引导语,主要内容藏在“展开全文”“查看详情”之后,需要交互才出现。
- 正文放在 tab、折叠面板或轮播里,默认不展示,文本虽然在页面结构中,但可读性很差。
- 正文以 PDF、附件下载或需要登录才能查看的形式存在,抓取端看到的是提示文字。
- 模板文字占比过高,推荐阅读、相关文章标题层层堆叠,正文被稀释。
怎么确认搜索蜘蛛实际读到了什么
- 用 URL 检查类工具查看“抓取的页面”原始 HTML,而不是只看自己浏览器里渲染之后的效果。
- 在浏览器里关闭或限制脚本后再打开页面,看正文是否还在。
- 对比该 URL 在搜索蜘蛛日志里的响应字节数与同类正常页面。字节数明显偏小,往往意味着拿到的是壳。
- 把页面文本复制到纯文本编辑器里,看看标题、正文、导航各占多少比例。
- 换几个同类页面重复上述步骤。如果问题出现在模板层面,通常整站同类页面表现一致。
把正文交到抓取端能看到的地方
- 关键信息用 HTML 文本直接写在页面里,图片作为补充,而不是唯一载体。
- 图片配上描述清楚的 alt,让图片承担的信息至少能被读成文字。
- 折叠面板、tab 里的内容,尽量在默认状态下也存在于 HTML 中,交互只影响展示,不影响可读。
- 正文尽量靠前,模板化的推荐模块和相关链接放到正文之后,减少对正文的稀释。
- 如果内容必须依赖脚本渲染,确认渲染链路稳定,不要出现抓取端偶尔拿到空壳的情况。
- 不用为了摘要去堆关键字。摘要是否采用、怎么截取,最终由搜索系统判断。
抓取到、编入索引、在搜索结果里被引用,是三件不同的事。摘要不好看时,先确认中间那一环——索引里到底存了多少你的正文,比反复琢磨摘要文案更实际。