打開後台的收錄狀態报告,最容易被做错的一件事,是把它当成一張待办清單——看到“已排除”就想去点提交,看到“已抓取未编入索引”就反复推送。實际上這份报告更像一張体检结果:它告诉你 URL 停在了鏈路的哪一段,而不是告诉你该按哪個按钮。
先把几十種提示归到四段鏈路上
一個 URL 從产生到出現在搜尋结果里,大致要走四步:被發現、被抓取、被索引、被展示。报告里的狀態提示,基本都能塞進這四段之一。
- 走完了:已编入索引。說明前几步都通了,剩下的只是展示层面的問题。
- 卡在中游:已發現但未抓取、已抓取但未编入索引。入口有了,抓取也發生了,問题出在優先級或质量判断上。
- 被挡在门外:robots.txt 屏蔽、noindex、需要登入、返回 4xx。這類是主動或被動拒绝,要先確認是不是你的本意。
- 被合並:重复網頁、备用網頁、未選定的規范網頁。說明系統認為你给了多個地址指向同一份内容。
几個最常被誤讀的提示
已發現,目前未编入索引
含义接近“地址我知道了,但還没轮到你”。常见原因有三類:URL 埋得太深,只靠提交清單而没有站内連結;站点整体抓取次數有限,新頁面排在後面;頁面本身没明顯問题,只是需要時間。這时反复提交不會带来額外作用,更值得做的是把它接到一個确實會被抓取的列表頁或正文里。
已抓取,尚未编入索引
這一步已经拿到了頁面内容,卡在索引判断上。值得回头看的是:正文是不是太短、模板文字占比是不是過高、是否與站内其他頁面高度相似、是否主要靠 JS 才能渲染出内容。這個狀態通常不會因為等待而自愈,改内容比改提交方式有效。
重复網頁與未選定的規范網頁
同一份内容出現在多個地址时,系統會自己挑一個作為代表,其余归入备用網頁。如果發現代表頁挑错了,先检查 canonical 是否寫反、是否指向了重定向地址或參數頁。這類問题不解决,後面所有收錄動作都是白費力气。
已排除:noindex 與 robots.txt
两者都會让 URL 從索引里消失,区別在于能不能被看到。noindex 允许抓取後再排除,robots.txt 直接挡在门口,抓都抓不到。想让一條頁面彻底消失,两者效果接近;想让頁面留在索引里只是不展示摘要,則两者都不适用。
讀报告时容易踩的几個坑
- 資料有滞後。当天改完当天去看,看到的往往還是舊结果,至少隔一两個抓取周期再下结论。
- 分類只记一個。同一條 URL 可能同时符合重复和單薄两個條件,报告只會顯示其中一種,別把它当成全部原因。
- 按目錄聚合。多數报告是按路径分组的,真正要看的往往是具体某條 URL,需要点開细看。
- 只看快照不看趋势。數量偶尔波動很正常,连續两周朝同一方向變化才值得處理。
一個可以照着走的核對顺序
- 確認這條 URL 到底该不该被收錄。栏目頁、參數頁、站内搜尋结果頁常常本来就不该進索引。
- 检查能否被抓取:返回碼是不是 200、有没有被 robots.txt 挡住、是否强依赖 JS 渲染。
- 检查有没有给出排除信号:noindex、canonical 指向別處、meta 與 HTTP 头冲突。
- 检查内容本身:與站内其他頁面的重合度、正文的有效信息量、是否有獨立價值。
- 检查入口:有没有内鏈、有没有進 sitemap、离首頁几跳。
- 把结论记進自己的台帳,隔一段時間回看狀態有没有變化,避免重复排查同一批 URL。
收錄是结果,不是開關。报告上的每一條提示,指向的都是鏈路上某個具体环节,而不是一個可以反复点击的按钮。
按這個顺序走一遍,多數“為什么没收錄”的問题都能落到一個具体動作上:要么补入口,要么改内容,要么收住本来就不该被收錄的地址。真正难的不是讀报告,而是忍住不去做那些看起来有用、實际不改變任何环节的操作。