站点运营:搜索蜘蛛的URL发现,从单页应用的前端路由说起
单页应用的页面切换靠前端路由完成,用户觉得顺滑,但蜘蛛看到的可能只有一张 HTML。本文讨论 hash 与 history 模式的区别、首屏源码里该如何保留真实链接,以及服务端渲染、预渲染和站点地图兜底的取舍。
阅读全文 →共找到 40 篇与“seo基础”相关的文章。
单页应用的页面切换靠前端路由完成,用户觉得顺滑,但蜘蛛看到的可能只有一张 HTML。本文讨论 hash 与 history 模式的区别、首屏源码里该如何保留真实链接,以及服务端渲染、预渲染和站点地图兜底的取舍。
阅读全文 →很多站点把 robots.txt 和 noindex 当成同一件事,结果该消失的页面还在,该被抓的内容却抓不到。本文梳理两者的分工、常见的写反场景、移除 URL 的正确顺序,以及 robots.txt 的语法细节与验证方法,帮助你把抓取管理做在可控范围内。
阅读全文 →XML站点地图常被当成一次性提交任务,其实它是长期的URL清单。本文聊分片的判断信号、lastmod的写法、哪些URL不该进地图,以及和维护流程的配合方式。
阅读全文 →评论、论坛、问答等用户生成内容往往带来大量站内链接,既可能帮蜘蛛发现新 URL,也可能制造重复、低质和参数陷阱。本文从审核、分页、动态加载、用户主页与链接属性几个方面,整理 UGC 场景下的 URL 发现与站点运营思路。
阅读全文 →内容量上来后,常有页面迟迟没有抓取记录,问题往往出在 URL 的目录层级与站点深度上。本文梳理常见的层级问题、压浅深度的具体做法,以及如何用日志和爬虫工具自查,帮助蜘蛛更低成本地发现重要页面。
阅读全文 →站内链接写法不一致时,同一个页面可能以大小写不同、尾斜杠有无不同的多种形态被爬虫记录。本文从尾斜杠规则、大小写来源、301 收敛、内链与 Sitemap 对齐几个角度,讲清如何减少重复 URL,让抓取更集中。
阅读全文 →图片是很多站点容易忽略的URL入口。本文拆解原生懒加载与JS懒加载的区别、srcset与picture的取舍、背景图与延迟iframe带来的影响,并给出一份可执行的自查清单,帮助你在不牺牲加载性能的前提下,让页面里的地址更容易被发现。
阅读全文 →预览链接和定时发布都发生在内容正式登场之前,这个阶段的URL状态如果没管好,容易产生重复副本、空壳页和孤儿页。本文梳理预览页的noindex处理、发布前后的状态切换、入列动作以及如何用日志验证,帮助站点把URL发现这件事做在流程里。
阅读全文 →搜索蜘蛛发现新URL,主要靠页面之间的链接。内链锚文本和面包屑这两块常被当成装饰,实际决定了爬虫能不能顺着路径走到深层页面。本文从链接入口、锚文本写法、面包屑层级表达和维护检查清单几个方面,梳理一套可执行的日常检查方法。
阅读全文 →前端框架渲染后,页面在浏览器里能点,但搜索蜘蛛拿到的HTML里可能没有任何链接。本文梳理单页路由、用点击事件代替a标签、滚动懒加载等常见失效写法,给出查看源码、禁用JS、日志对比等排查方法,以及首屏服务端输出链接、Sitemap补充等折中方案。
阅读全文 →