评论、论坛帖、問答、用戶主頁這類由訪問者产生的内容,统称 UGC。它們更新频繁、數量增長快,也很容易把索引撑大:一篇正文只有几百字的文章,可能挂着几十頁评论;一個空壳用戶主頁也能被單獨訪問。收錄决策如果一刀切,要么把有價值的讨论挡在门外,要么让大量低质頁面占用抓取和索引空間。更實际的做法是先分层,再分別選技術手段處理。
為什么 UGC 頁面容易被大量抓取
原因通常不在 UGC 本身,而在入口和 URL 结构。
- 评论分頁、楼层連結、回复锚点會生成一串可訪問地址,只要站内互相連結,搜尋引擎就能顺着走。
- 用戶主頁、标簽聚合、關注列表往往是“入口多、内容薄”,同一批連結從多個位置反复被指向。
- 新评论没有审核就直接上线,頁面内容随抓取時間不同而變,容易产生近似重复的快照。
這也是為什么许多站点在抓取日誌里看到大量 UGC 地址被訪問,但真正被编入索引的比例並不高:抓到了不等于值得收。
先分层:哪些 UGC 有獨立價值
值得放行的一類
能獨立回答一個問题、有明确主题和一定篇幅的内容,例如:
- 有實质内容的長评、使用体驗、對比讨论
- 有明确問题與可讀回答的問答帖
- 被多個頁面引用、有外部連結指向的讨论串
判断标准不是“谁寫的”,而是“單獨打開這個地址,用戶能不能得到有用信息”。
建议收敛的一類
- 纯表情、纯“顶”、纯抱怨但無信息的短评论
- 篩選後無内容的聚合頁、空结果頁
- 没有發帖记錄、没有简介的用戶主頁
- 回复楼层分頁的第二頁之後(多數情况)
處理顺序:先收入口,再谈放行
- 先看連結。低價值 UGC 頁面的最大問题是内鏈太多。减少“最新评论”“热门回复”這類全站可见的模块指向無差別列表,比逐個加 noindex 更省事。
- 再定 URL 形態。评论楼层尽量用參數或锚点承载,不要為每一层生成獨立路径;分頁统一為一種寫法,避免 ?page=2 與 /page/2/ 並存。
- 然後才是頁面級指令。對确實要保留但不希望進索引的頁面,用 noindex 表達;對已经不该存在的地址,用 404 或 410 處理,而不是長期 302。
- 最後观察抓取。改動後在抓取日誌和索引报告里看訪問量、收錄量的變化趋势,通常需要數周才能看清方向,不要按天判断。
技術手段怎么選
几種常见组合:
- 整類收敛:用 robots.txt 屏蔽评论分頁、用戶主頁目錄。需要注意,被屏蔽的頁面如果已有外鏈,索引里可能仍保留一個無摘要條目;而 robots 屏蔽與 noindex 同时使用會失效,两類處理要分開做。
- 頁面級取舍:對有價值的讨论串放行,對薄頁面加 meta noindex。noindex 頁面仍會被抓取,所以不适合用在海量地址上。
- 合並同類:同一個問题的多個讨论串,選内容最全的一條作為展示頁,其余做 301 或 canonical 指向,不要留下多個近似頁面。
- 控制更新:评论审核後再放出,避免同一地址短時間内反复變動,让搜尋引擎反复重抓。
抓取工具能改變的往往只是訪問频次和發現速度,改變不了頁面本身是否值得進索引。UGC 的收錄問题,大部分要在内容價值和連結结构上解决。
几個常见誤区
- 以為 noindex 能省抓取:noindex 頁面依然需要被抓取才能讀到指令,想省抓取要靠 robots.txt 或减少入口連結。
- 把收錄量当成绩:UGC 數量增長带来的收錄增長,往往伴随平均质量下降,反過来影响整站的抓取分配。
- 一刀切屏蔽全部评论:有真實讨论的内容常常是長尾入口,全部屏蔽等于放弃這部分價值。
一個可执行的检查清單
- 導出近一個月的抓取日誌,按目錄統計 UGC 地址的訪問占比。
- 抽样打開已被收錄的 UGC 頁面,看正文是否可讀、是否有獨立主题。
- 整理“放行、noindex、屏蔽、合並”四類清單,落到具体 URL 規則。
- 减少全站模块對低價值列表的連結,改由站内搜尋或分层入口承担。
- 改動後按周查看抓取與索引資料,逐步調整,避免一次性全量切換。
UGC 收錄不是非黑即白的選擇题。把頁面按價值排排序,再把連結、URL 形態和索引指令分別用對地方,索引里留下的就會更接近你真正希望被搜到的内容。