站点收錄率只是一個統計结果,真正被判断的對象是每一個 URL。同一個目錄下,有的頁面很快進索引,有的抓過几次就没了下文,差別通常不在运气,而在頁面本身能提供多少可用信息。下面這几項,是把一個頁面單獨拿出来时比較常被關注的方面。
一、正文主体能不能被直接取到
處理一個頁面时,先要拿到它的主要内容。如果正文只存在于交互之後,比如点開标簽、滚動加载、点击展開全文才出現,首屏 HTML 里只有框架和占位文字,那么這個 URL 可被判断的信息就非常有限。
- 正文寫在 HTML 里,還是等脚本請求回来才出現;
- 有没有全屏彈窗、浮层、跳轉頁挡住主体内容;
- 同一段正文是否被推荐位、相關阅讀、评论切成很多碎片,導致主次不清。
不需要刻意做特殊版本,但要保證在不执行脚本的情况下,頁面的核心信息仍能讀出一個大概。
二、内容是否唯一,主题是否清楚
模板相同不代表内容重复,但如果正文部分高度相似,頁面之間就很难被区分對待。常见情形有几類:
- 列表頁、篩選頁只有排序不同,條目完全一致;
- 商品或文章正文直接沿用来源站的描述,站内多個 URL 内容雷同;
- 頁面大部分是導航、广告、推荐,真正的正文只有一两句话。
主题清楚,是指從标题、H1、首段就能判断這個頁面在讲什么。若一頁里塞了三四個不相關的主题,或者标题里堆了一串關鍵詞,頁面就很难获得一個明确的定位。
三、有没有稳定、可预期的入口
入口影响的不只是能否被發現,也影响這個 URL 在站内是否被当作正式内容:
- 是否有站内連結指向它,而不是只靠 sitemap 或提交接口;
- 連結出現在導航、栏目頁,還是頁脚一長串連結里;
- 連結指向的 URL 與 canonical、實际訪問的 URL 是否一致。
如果站内没有任何連結指向某頁,或者連結文字長期是「点击這里」「更多」,這類頁面被当成獨立内容處理的机會會小很多。
四、技術层面的可用性
這一层不是加分項,而是门槛:
- 返回稳定的 200,不频繁出現 5xx、超时、限流;
- 不要求登入、驗證碼或特定地区才能看到内容;
- canonical、robots、分頁關系之間不互相矛盾;
- 移動端能正常阅讀,不做强制跳轉或大面积遮挡。
收錄是结果,不是可以單獨優化的動作。頁面能不能被收錄,多數时候取决于它本身是否值得被單獨拿出来。
五、按顺序自查單個頁面
與其盯着總收錄數,不如抽几個典型 URL 逐項核對:
- 禁用脚本打開頁面,看還剩多少正文;
- 把頁面文字複製出来,看有多少是自己獨有的内容;
- 用站内搜尋或連結检查工具,確認它是否被内鏈指向;
- 看服務器日誌里這個 URL 的抓取频率和返回狀態。
按這個顺序過一遍,大部分「為什么不收錄」的疑問都能落到具体某一項上,而不是停在猜测。需要提醒的是,頁面质量只是前提,最终是否進入索引、以哪個 URL 進入,仍由搜尋引擎按自己的規則判断,我們能做的是把可控制的部分做扎實。