收錄是资源分配,不是預設動作
很多站点的問题不是“為什么没收錄”,而是“為什么這個頁面也被收錄了”。一旦低價值頁面進入索引,後續要做 canonical、noindex、410、内鏈清理,成本往往比上线前多判断一步高得多。收錄本质上是在向搜尋引擎表達:這個地址值得占用一個索引位置。既然索引位置有限,就不该让所有頁面預設開放。
更稳妥的做法是:新頁面、新栏目、新功能上线前,先回答一個問题——如果用戶通過搜尋進入這個頁面,他能不能得到別處没有的、完整的答案?如果答案是否定的,先不要急着让它被收錄。
先判断頁面有没有獨立價值
獨立價值不是“頁面上有内容”就算,而是這個頁面能否單獨满足一個明确的搜尋需求。可以用下面几個問题快速核對:
- 頁面是否在解决一個具体問题,而不是只做入口或跳轉?
- 頁面是否有獨有的信息,比如資料、步骤、案例、說明,而不是從別處複製或拼接?
- 同一批用戶是否可能直接從搜尋结果進入這個頁面,而不需要先回到首頁?
- 這個頁面和站内已有頁面是否高度相似?如果只是篩選條件不同,内容框架几乎一样,收錄後很容易互相稀释。
- 頁面更新後,是否值得让搜尋引擎重新抓取和更新索引?如果只是临时狀態,收錄價值通常很低。
這些問题不需要全部满足,但如果大部分都答不上来,這個頁面就更适合先作為站内功能頁存在,而不是作為搜尋落地頁。
這些頁面建议先不開放收錄
下面几類頁面不是永遠不能收錄,而是在没有明确运营目标时,建议先收口:
- 篩選、排序、參數组合頁:它們通常由同一套模板生成,内容差异很小,容易产生大量近似 URL。
- 空集合頁和结果為空頁:没有實际内容,用戶進入後也無法繼續操作。
- 測試頁、预览頁、临时活動頁:生命周期短,收錄後很快失效,反而增加死鏈和重复入口。
- 用戶中心、登入後頁面:對未登入用戶没有完整内容,搜尋引擎看到的和用戶看到的不一致。
- 重复列表和分頁深頁:如果列表内容已被分類頁覆盖,深分頁的收錄價值通常有限。
- 纯聚合頁:只是把其他頁面标题和摘要拼在一起,缺少自己的整理和判断。
不開放收錄不等于刪除頁面。可以通過 robots.txt 限制抓取、設定 noindex、保持頁面僅供站内跳轉,或者用規范 URL 指向主版本。關键是別让它們以獨立地址進入索引。
URL入口要统一
一個頁面最好只有一個規范 URL。常见問题包括:带參數和不带參數各收錄一份、大小寫不同各收錄一份、尾斜杠不同各收錄一份、http 和 https 同时存在。上线前如果能把入口统一,後面的收錄收口會轻松很多。
具体可以核對:
- 站内連結、導航、面包屑是否都指向同一個規范地址?
- sitemap 里是否只放規范 URL,而不是把所有參數變体都提交?
- canonical 是否指向自身或明确的主版本,而不是指向一個不存在的地址?
- 分頁、篩選、排序是否會用 rel=canonical 或 noindex 做取舍?
URL 規范不是一次性設定,而是上线後每次新增入口时都要检查的习惯。只要入口混乱,收錄就會跟着混乱。
抓取、索引、展現是三件事
很多人把抓取、收錄、排名混在一起看,结果日誌里看到蜘蛛来過,就以為頁面已经收錄;site 查询没有结果,就以為頁面被惩罚。實际上這是三個阶段:
抓取是搜尋引擎訪問了頁面;索引是把頁面内容收錄進資料库;展現是頁面在搜尋结果中被排序並展示出来。
被抓取不等于被索引,被索引也不等于有展現。頁面可能被抓取後判定為低质量而不入库;也可能已经入库,但没有匹配到合适的查询,所以没有展現。排查时要把這三個狀態分開看,才能找到真正卡住的一步。
上线後的核對顺序
如果頁面已经上线,建议按下面的顺序观察,而不是一上来就反复提交或改模板:
- 先看服務器日誌,確認搜尋引擎是否抓取了規范 URL,返回狀態碼是否正常。
- 再看頁面是否被索引,可以用 site 查询或站長後台的索引狀態做交叉核對。
- 如果已抓取但未索引,回到頁面價值、内容重复度、URL 規范這几個方向自查。
- 如果已索引但没有展現,检查頁面主题是否清晰、标题和正文是否匹配用戶查询。
- 如果頁面本来就不该被收錄,尽早用 noindex、canonical 或 robots.txt 收口,不要等到大量收錄後再清理。
收錄不是越多越好,而是越准越好。上线前多問一句“這個頁面值不值得被收錄”,往往比上线後花几周做收口更省力。把入口規范、頁面價值和狀態核對分開處理,收錄問题會清晰很多。