新站上线一段時間後,打開索引报告,常會看到首頁、分類頁、标簽頁、归档頁已经被收錄,真正希望被搜到的内容頁却還停在“已發現”或“已抓取,未收錄”。這個顺序看起来有点奇怪,但多數情况下並不意外。
抓取入口决定了先看到谁
搜尋引擎發現 URL 的起点通常集中在外鏈、導航和 sitemap。外鏈指向的多是首頁;全站導航也常把首頁和栏目頁放在最顯眼的位置;sitemap 虽然可以列出所有内容頁,但它提供的是發現通道,不是優先收錄的指令。入口在哪里,爬虫就先往哪里走。
換句话讲,索引先出現首頁和归档頁,往往只是連結结构的自然结果,並不代表這些頁面质量更好。
归档頁和标簽頁為什么也快
這類頁面由模板批量生成,連結密集,列表更新時間频繁,還常有站内互相連結。對爬虫来说,它們是通往大量内容頁的路口,自然容易被反复訪問。但被频繁抓取不等于值得被收錄。如果归档頁内容單薄、和内容頁大量重复,長期留在索引里反而會稀释頁面质量,也可能让用戶点進去後找不到想要的内容。
内容頁慢半拍,常见原因
- 入口位置深:只能從第二、第三层列表進入,或必须翻分頁才能看到。
- 内鏈太少:正文里没有相關推荐、上下篇或同類聚合連結。
- 更新频率低:發布後長期不動,爬虫重訪間隔被拉長。
- 與模板頁差异小:标题、摘要和列表頁高度相似,容易被当成重复内容處理。
- 被硬性設定挡住:noindex、robots.txt 或參數規則誤拦,自查时先排除這類問题。
把抓取注意力引向内容頁的几種做法
- 列表頁保留到内容頁的直接連結,不要只用 JS 点击加载。
- 正文中加入相關文章、同标簽聚合和上下篇連結,让内容頁彼此连通。
- sitemap 優先放内容頁和更新频繁的聚合頁,不要把每個篩選參數都寫進去。
- 减少無意义的归档頁、标簽頁,或给它們加上 noindex,把入口留给内容頁。
- 更新已有内容頁时同步更新 sitemap 的 lastmod,但不要伪造時間。
自查顺序
先看抓取日誌里内容頁是否被訪問過。如果没被訪問,問题在發現路径;如果被訪問但没進索引,再去看頁面质量、重复内容和 noindex 設定。這個顺序能把“没被發現”和“被發現但没收錄”分開,避免一上来就改内容。
抓取是通道,收錄和搜尋表現還取决于頁面本身能提供什么。
有人會尝试用蜘蛛池制造大量入口,让爬虫频繁来訪。短期抓取量可能上升,但如果入口頁面没有真實的連結關系,或者内容质量不變,索引结果通常不會跟着改善。把它当成辅助观察工具可以,当成收錄的保證就會失望。
一個可操作的检查点
在導航、面包屑和列表頁中,找一個普通用戶能点到内容頁的最短路径。如果這條路径超過三次点击,或者必须依赖搜尋框、篩選和分頁的组合,爬虫發現它的概率也會下降。先把這條路径缩短,再观察索引报告的變化,比反复提交 URL 更實际。