网
页面分层与收录优先级:哪些地址值得进索引,哪些只要被爬到
站内 URL 变多以后,收录量却不涨,很多时候是因为没有区分地址类型。这篇文章把站内地址分成需要进索引、只需被爬到、边界模糊三类,并说明 noindex、robots.txt 与 canonical 各解决什么问题,最后给出一套可以定期执行的检查流程。
阅读全文 →共找到 2 篇与“索引管理”相关的文章。
站内 URL 变多以后,收录量却不涨,很多时候是因为没有区分地址类型。这篇文章把站内地址分成需要进索引、只需被爬到、边界模糊三类,并说明 noindex、robots.txt 与 canonical 各解决什么问题,最后给出一套可以定期执行的检查流程。
阅读全文 →robots.txt 管的是抓取,不是收录。本文说明被 Disallow 的地址为何仍可能出现在索引里、只留 URL 的空条目是怎么形成的,以及 disallow 与 noindex 同时使用时会出什么问题,并给出让页面真正退出索引的处理顺序。
阅读全文 →