收錄不是一步完成的
一個 URL 從發布到出現在搜尋结果里,通常要经過四步:被發現、被抓取、被索引、被展現。多數人的注意力都放在“收錄”這個词上,但真正决定快慢的往往是第一步和第三步——頁面有没有被蜘蛛發現,抓到的内容够不够獨立、够不够完整。
决定首次收錄時間的几個變量
1. 站内入口的位置和深度
首頁、栏目頁、列表頁上的連結,蜘蛛回訪频率高,通常几個小时到几天就能發現新 URL。埋在第五、六层目錄、全站只有一條連結指向的頁面,被發現的時間要多等一轮甚至几轮抓取周期。發布之後最该做的一件事,是让新頁面從已有的高權重頁面有一條可点击的路径可達。
2. 站内連結的數量與质量
两三處来自相關頁面正文的連結,比導航、頁脚里几十條批量連結更有效。連結的锚文本最好和頁面主题相關,清一色的“点击這里”對判断頁面内容没有帮助。
3. 内容是否“只此一份”
如果新頁面只是把已有内容換個标题重排一遍,即使被抓取了,也可能不進索引,或者被归並到別的 URL。頁面上真正獨有的段落有多少,往往比總字數更能說明問题。
4. 站点整体的抓取节奏
蜘蛛分配给一個站点的抓取量相對有限。当站内存在大量低價值 URL(參數頁、空列表頁、重复聚合頁)时,抓取量會被這些地址消耗掉,新頁面排到的顺序就會往後。清理這類 URL,通常比反复提交 sitemap 更管用。
5. 服務器响應與可訪問性
抓取时返回超时、5xx,或者需要执行大量脚本才能看到正文,都會让這一轮抓取白跑,下一次要重新排期。让頁面在無 JS 的情况下也能看到主要文本,是减少返工的办法。
發布後可以做的几件事
- 確認頁面從首頁或栏目頁有真實可点击的連結,而不是只能靠站内搜尋框找到。
- 把新 URL 加入 sitemap,並把 lastmod 更新為實际修改時間,不要每次全站刷一遍。
- 检查頁面没有被 robots.txt 挡住、没有 noindex,也別让登入狀態或地区限制拦住蜘蛛。
- 看服務器日誌里這個 URL 的出現情况,比凭感觉猜测更直接。
- 内容先寫完整再上线,避免發布後连續大改,導致已经抓取的版本作废。
几個常见誤解
“提交了就應该很快收錄”
提交只是帮助發現,是否抓取、何时抓取由蜘蛛自己决定。任何工具都不保證一定收錄,也不保證時間。
“過一天没收錄,就說明頁面有問题”
不同站点的常規周期差异很大。新站、抓取频率偏低的站点,等上一两周都在正常范围内。频繁改動頁面或大量重复提交,反而會打乱节奏。
更實用的做法是记錄一批新頁面的發布時間和實际被抓取的時間,用自己站点的資料建立一個预期,而不是拿別人的经驗值来對照。
什么时候需要警惕
如果同類頁面里只有個別 URL 長期不被發現、不被抓取,通常指向入口和内鏈問题;如果是整批新頁面都卡在“已發現”狀態,就要看抓取量分配和站内低质 URL 的占比;如果抓取正常却一直不進索引,則回到内容本身:是否重复、是否過于單薄、是否與其他頁面高度相似。