网
初始HTML里没有正文,蜘蛛抓到的可能只是一个页面外壳
抓取正常、状态码 200,页面却迟迟不进索引,问题有时出在初始 HTML 上。本文说明正文依赖前端渲染、藏在交互之后、以图片或附件形式存在等几种常见空壳来源,给出用 curl 和禁用 JavaScript 自查的方法,以及模板层面的处理顺序。
阅读全文 →共找到 1 篇与“HTML”相关的文章。
抓取正常、状态码 200,页面却迟迟不进索引,问题有时出在初始 HTML 上。本文说明正文依赖前端渲染、藏在交互之后、以图片或附件形式存在等几种常见空壳来源,给出用 curl 和禁用 JavaScript 自查的方法,以及模板层面的处理顺序。
阅读全文 →