抓取和收錄是两件事:蜘蛛来過、返回 200,只說明這個地址能被訪問;是否進索引,還要看頁面本身能不能被判断為“值得留下的一個结果”。這個判断没有公開的分數,但從頁面上能观察到一些线索。把頁面质量当作上线前的自查項,比事後盯着收錄數字猜原因要省事。
一、正文在頁面里占多大比重
一個頁面的 HTML 里通常混着導航、侧栏、推荐位、頁脚、版權、广告位。搜尋引擎要把正文從這些内容里分离出来,噪声越多,判断越困难。
- 把頁面的可见文字複製出来,去掉導航和頁脚,剩下的是不是主要信息;
- 正文是不是長到足以獨立回答一個問题,而不是一句话加一堆按钮;
- 列表頁、聚合頁有没有自己的說明文字,還是只有标题的堆叠。
如果正文只有两三行,其余全是連結和模块,這個頁面更像一個入口而不是一個结果。入口可以有,但不必都進索引。
二、模板重复的部分會不會盖過正文
同一套模板生成几百個頁面时,頁面之間相同的段落會非常多。相同的部分越多,頁面之間可区分的信号越少。
- 頁面上有没有大段全站一致的介绍文字,出現在每個頁面同样的位置;
- 不同的頁面,前几屏内容是不是几乎一样,差別只在标题里換了一個词;
- 结构化字段有没有填满,還是大量留空。
三、和站内已有頁面是否高度近似
重复不只發生在不同站点之間,更常见的是自己站内。同一件事寫了两三個版本、同一批資料按不同參數展開成很多地址,都會让索引面临“留哪個”的問题。
检查方式:抽几個頁面,把正文開头一段放進站内搜尋或搜尋引擎加 site: 限定,看有多少地址返回几乎相同的文字。如果同一個意思對應几十個地址,先想清楚哪個是主版本,再用規范标簽、内鏈和站点地图把信号集中到一個地址上。
四、頁面给出的信息是否完整
- 标题能不能说清這個頁面到底讲什么,而不是品牌名加一串關鍵詞;
- 有没有一段摘要或導语,让阅讀者在不点開之前就知道内容;
- 更新時間、作者、来源這類信息是否真實,而不是每次都自動刷新。
五、上线前的自查清單
- 去掉模板後,正文是否仍然成立;
- 站内是否存在明顯近似頁面,主版本是否唯一;
- URL 是否可以長期稳定,不随參數或會话變化;
- 頁面是否能在不执行脚本的情况下看到主要内容;
- 该頁面對用戶是否有明确用途。
六、什么时候選擇不收錄
並不是所有頁面都要進索引。篩選结果頁、内部搜尋頁、登入後的頁面、内容极少的临时頁,用 noindex 明确排除,比让它們挤在索引里再被淘汰更干净。要注意 noindex 和 robots.txt 管的是不同环节:前者针對收錄,後者针對抓取,不要用错。
收錄不是奖励,而是搜尋引擎認為這個地址值得作為一個结果保留。质量自查的目的不是讨好某個算法,而是让每個能被訪問的地址都清楚地说出自己是什么、有什么用。