很多人把“收錄”当成一個動作,實际上它是一條鏈路:URL 被發現、被安排抓取、内容進入索引库、最後才有机會在搜尋结果里展示。任何一环卡住,表現都可能是“没收錄”或“收錄不稳定”。如果一上来就改内容,往往排查不到点上。
先看 URL:參數、大小寫和尾斜杠
搜尋引擎對 URL 的识別是字符串层面的。同一個頁面如果出現多個 URL 版本,比如带不带追踪參數、带不带尾斜杠、大小寫不一致,就可能在索引里分散成多個地址。常见来源包括:
- 站内連結寫法不统一,一部分带 ?from=xxx,一部分不带;
- 分享、广告或統計工具自動追加參數;
- 服務器對大小寫和尾斜杠不做归一,返回不同狀態碼或同一内容。
處理顺序通常是:先统一站内連結,再给規范版本設定 canonical,最後用 301 把明顯的變体收口。不要在同一個頁面同时放多個相互矛盾的信号,比如 canonical 指向 A,内鏈却大量指向 B。
重复内容:先分主版本,再谈取舍
重复不一定是抄袭,更多时候是同一套内容的多個入口。例如篩選頁、排序頁、打印頁、分頁聚合頁,以及不同參數生成的列表。它們可能都返回 200,也可能都被抓取。如果不做区分,索引容易把權重和抓取预算分散掉。
可以按信息增量分三档:
- 有獨立價值:保留,並让 canonical 指向自身;
- 只是入口變体:用 canonical 指向主版本,或設定 noindex 但保留抓取;
- 無内容或空结果:考虑 404/410,或至少返回 noindex,避免软 404。
判断标准不是“這個 URL 好不好看”,而是“用戶通過它能不能得到與主版本不同的有效信息”。
頁面质量:收錄前先看信息增量
即使 URL 干净、也被抓取了,頁面仍可能因為质量信号不足而進不了索引。可以從几個角度自检:
- 正文是否主体明确,還是模板、導航、推荐位占了大部分;
- 标题和摘要是否與頁面内容一致,有没有堆關鍵詞;
- 列表頁是否有足够條目,還是只有几條重复卡片;
- 用戶评论、問答、聚合頁是否提供了原頁面之外的信息。
质量不够时,優先补内容或合並頁面,而不是反复提交 URL。提交只能增加被發現的机會,不能替代頁面本身的可索引性。
抓取與收錄不是一回事
日誌里看到蜘蛛来過,只說明 URL 被抓取過,不代表已经進入索引。抓取之後還要经過内容解析、去重、质量判断和索引調度。因此會出現“抓取正常但索引不涨”的情况。核對时至少把三段分開:
- 抓取:看服務器日誌、工具里的抓取統計;
- 入库:看索引狀態、規范版本選擇;
- 展示:看搜尋關鍵詞、标题摘要和排名。
不同工具的資料口径和更新時間不同,對不上是常態。先確認資料来源,再判断是否存在真實問题。
一個可执行的核對顺序
- 確認目标 URL 返回 200,且内容與用戶看到的一致;
- 检查站内連結是否都指向規范版本;
- 检查 canonical、robots、noindex 是否互相冲突;
- 確認頁面有獨立信息增量,不是纯模板或空列表;
- 区分抓取與索引資料,留出合理的更新时差;
- 若仍無變化,再回到 URL 發現和内鏈入口排查。
收錄是结果,不是單次操作。把 URL 規范、重复版本和頁面质量分開核對,比反复提交或频繁改動更容易找到真正的阻塞点。