站内聚合頁面指的是由站内規則自動生成、把多篇内容聚在一起展示的頁面:标簽頁、分類归档、搜尋结果頁、按條件篩選出的列表頁都属于這一類。它們的存在是為了让用戶找到内容,但對搜尋引擎来说,這些頁面是否值得進入索引,需要單獨判断。放行太多會稀释站点整体的质量信号,全部屏蔽又可能切断重要内容的發現路径。
先按用途把聚合頁分成几類
- 編輯维護的聚合頁:人工挑選内容的专题頁、榜單頁。數量少、内容稳定,通常值得放行。
- 規則生成的标簽頁:由标簽自動聚合,质量取决于该标簽下内容的數量與相關性。标簽下只有一两篇内容时,頁面價值接近空壳。
- 站内搜尋结果頁:由用戶查询词触發生成,數量几乎無上限,且容易产生内容重复。除非你為某些高频查询做了人工優化的落地頁,否則一般不建议让搜尋引擎抓取和收錄。
- 參數篩選與排序頁:颜色、價格、排序方式等组合會产生大量近似 URL,同一批内容被反复展示。
判断放行與否,先問几個問题
- 這個頁面是否有獨立、可讀的内容摘要或編輯說明,而不是纯粹的連結列表?
- 同類頁面之間的差异是否足够大?如果两個标簽頁九成條目重合,它們大概率會被当作近似頁面處理。
- 頁面是否有稳定的引用需求,也就是有人會主動連結到它、把它当作一個入口?
- 把它從索引中拿掉,用戶還能不能從其他入口找到同样的内容?如果答案是能,屏蔽的代價就比較低。
常见處理手段與對應的坑
處理聚合頁主要有三種思路:放行、归並、屏蔽。三者的适用场景不同,混用容易出現互相矛盾的信号。
- 放行:适合内容量足够、有獨立摘要和編輯價值的聚合頁。放行之後要在内鏈里给它一個稳定位置,否則它同样可能長期停留在“已發現但未编入索引”。
- 归並(canonical 指向代表頁):适合一组高度相似、只需要保留一個版本的頁面。注意 canonical 是建议而非指令,如果被指向的目标頁本身质量不高,搜尋引擎仍可能自行選擇別的版本。
- 屏蔽:可以用 robots.txt 禁止抓取,也可以用 noindex 禁止索引。两者不建议同时用在同一個 URL 上——如果 robots.txt 挡住了抓取,爬虫看不到頁面上的 noindex,這個地址仍可能以“僅 URL”的形式留在索引里。
對聚合頁的處理目标不是“收錄更多”,而是让索引里的每個 URL 都有明确的代表意义。
落地的顺序建议
先導出近几個月從站内搜尋和标簽入口進入的落地頁資料,按流量和内容量排序;再從中挑出内容量明顯偏少、條目高度重合的部分,作為第一批處理對象。處理时一次只改一類,改完观察一段時間抓取和索引狀態再動下一類,避免同时改動多個變量後無法判断是哪一步起了作用。
另外,标簽頁的治理往往和内容侧的标簽体系有關。标簽定义混乱(同义词、單复數、大小寫不统一)时,聚合頁會自然分裂成多個近似頁面。這種情况下,先收敛标簽体系,比在頁面上挨個加 canonical 更省事,也更不容易反复。