排查收錄时,很多人把注意力全部放在“爬虫有没有来”上。但抓取和收錄之間還有一道判断:這個頁面值不值得占用索引空間。蜘蛛把 HTML 拿回去之後,引擎會先做一轮内容质量评估,评估不達标的 URL 可能長期停在“已發現”狀態——日誌里能看到抓取,索引里却没有它。
维度一:主体内容占比
把頁面上不属于正文的部分圈出来——導航、侧栏推荐、頁脚連結、广告位、彈窗、版權信息——剩下的部分才是主体。如果主体内容只占整頁 HTML 的一小部分,頁面在质量判断上就會吃亏。常见的情况是:一段两百字的介绍,被塞進十几個模块拼成的模板里,视觉上热闹,實际信息量很低。
维度二:模板化重复
分類頁、聚合頁、标簽頁最容易踩這條。同一套模板批量生成几千個 URL,每個頁面只有标题和几行摘要不同,其余完全一致。這類頁面單看没問题,放在一起看就是大量近重复内容。處理方式不是全部删掉,而是做区分:有獨立篩選價值、有真實搜尋需求的留下;纯拼接、無差异的收拢合並或设為不可索引。
维度三:頁面是否兑現了标题的承诺
标题寫着“办理流程”,正文却在讲公司简介;标题寫“價格表”,頁面只有一句“詳情請咨询”。這種错位會让頁面被判為不满足需求。判断方法很朴素:只看标题和首屏,問自己“用戶点進来想解决的問题,第一屏能不能看到答案的開头”。
维度四:技術层面的可用性
- 首屏依赖 JS 渲染,而渲染所需资源又被 robots.txt 挡住;
- 移動端排版错位,正文被浮层或吸底广告遮住;
- 服務器响應经常超时,抓取中途放弃,内容只取到一半;
- 主体文字寫在图片里,文字层為空。
這几條本身属于抓取與渲染問题,但结果會体現在质量判断上:引擎拿不到完整内容,自然無法给出正面评價。
维度五:内容是否有维護痕迹
長期不更新不是原罪,但頁面信息過期、站内連結大面积失效、联系电话已停用,會直接拉低可信度。反過来,有明确更新時間、有修订說明、正文中引用的信息仍然准确的頁面,在同類内容里更容易被保留下来。
质量判断没有公開的分數线,也不存在“做到這几点就保證收錄”的公式。上面這些是提高通過率的常见方向,不是通行證。
未收錄頁面的自查顺序
- 随机抽 10 個未收錄 URL,逐個估算主体内容占比;
- 把這些 URL 放在一起比較,看是否只是标题和几行摘要不同;
- 用渲染後的 HTML(不是源碼)確認正文可讀、無遮挡;
- 核對标题與首屏内容是否一致,是否存在答非所問;
- 检查最後更新時間與站内失鏈情况;
- 根據结果决定是补内容、合並頁面,還是調整索引放開的范围。
整体排查顺序通常是:先確認可抓取,再確認可索引,最後才轮到质量。前两關没過,谈质量没有意义;前两關都過了却長期不進索引,就该回到上面這几條逐項對照,而不是繼續往提交入口里堆 URL。