很多站点讨论收錄,习惯把“收錄量”当成一個單獨的數字来盯:涨了就高兴,跌了就排查。但搜尋引擎的索引並不是站内目錄的镜像,它是一個筛過一轮的结果集。同一批 URL 里,有些頁面天生就该進索引,有些頁面進不進其實無所谓,還有一些進了反而會摊薄整站的信号密度。與其等收錄结果出来之後再补救,不如在 URL 设計阶段就先分一次档。
分档不是内部标簽,它决定的是抓取與索引的動作
分档听起来像管理動作,但它最後一定落在技術處理上:這條 URL 要不要寫進 sitemap,内鏈要不要指向它,canonical 指向自己還是指向別人,robots 要不要放開,出現重复时以哪一條為准。這些問题如果没在分档时说清楚,就會出現同一個頁面在不同入口收到互相矛盾的信号。
判断一個頁面值不值得被收錄,先問三個問题
它有没有獨立的信息價值
把頁面的主体内容抽出来,去掉導航、推荐位、頁脚和模板文案,剩下的部分是不是只在讲這一件事。如果剩下的内容和另一條 URL 高度接近,只是排序、篩選條件或渠道參數不同,那它更像是同一條内容的另一個入口,而不是一條新頁面。
它能不能离開別的頁面單獨成立
结算頁、登入後的個人中心、提交成功頁、搜尋參數组合頁,這些頁面通常需要有前置操作才能進入,或者只在特定會话里才有意义。它們對用戶是必要的,但對外部检索来说缺少稳定的语境,让它們進入索引對谁都没有太大帮助。
它被搜到的场景是否真實存在
不要用“萬一有人搜呢”来支撑一條 URL 進索引。更實际的做法是看這條頁面解决的是不是一個明确的查找意图:有人會用什么词去找它,找到之後頁面能不能直接给出答案。如果答案分布在另外几條頁面上,這條頁面更适合做入口或聚合,而不是索引目标。
常见的分档誤判
- 把聚合頁和詳情頁混為一谈:聚合頁的價值在于组织入口,詳情頁的價值在于承载具体信息,两者的收錄策略没必要一致。
- 認為參數越多越“丰富”:同一内容配上不同的篩選、排序、追踪參數,很容易變成近似重复的一大片。
- 靠 noindex 處理本该合並的頁面:如果两條 URL 讲的是同一件事,優先考虑合並或規范,而不是一條留一條挡。
- 只按 PV 分档:浏览量低的頁面不代表没有检索價值,反過来浏览量高的頁面也可能是登入後才看得到的流程頁。
分档之後,動作要落到 URL 上
- 核心頁:canonical 自指,進入 sitemap,内鏈從相關頁面自然指向,保持可抓取、可索引。
- 入口與聚合頁:明确它是對内導航還是對外检索入口。對内為主的可考虑不進 sitemap,但也不必刻意屏蔽。
- 近似重复頁:先判断能不能归並到主 URL,能归並就归並,不能归並再用 canonical 指向主版本。
- 功能頁與流程頁:優先從站内可抓取范围收口,减少爬虫在無检索價值路径上的消耗。
- 已被索引的歷史遗留頁:先看它是否還有外部引用和真實訪問,再决定是繼續保留、合並,還是让它自然登出。
分档需要定期复查,而不是一次定终身
站点的頁面類型會變,业務重点也會變。今天放在“留在站内就好”那一档的頁面,可能因為内容积累變成了有價值的詳情頁;反過来,一些曾经的核心頁也可能在改版後只剩下模板骨架。建议按季度抽一批 URL 做抽查:内容是否還完整、頁面是否還能獨立成立、收到的信号是否一致。分档的目的不是把收錄量压到一個數字,而是让每一次抓取和索引决策都有明确的理由。
收錄不是越多越好,也不是越少越安全。真正需要盯的是:進入索引的那一批頁面,是不是站点希望別人看到的那一批。