URL 是頁面在站内的唯一标识,也是爬虫最先看到的一段文本。它不會直接决定頁面能不能被收錄,但會影响發現效率、去重判断和後續的维護成本。很多收錄問题回头看,源头只是一個命名混乱的連結。
slug 會被爬虫当作什么信号
爬虫處理一條新連結时,URL 本身能提供的信息很有限:域名、目錄结构、參數,以及一段可讀的词。這段词不會让低质量頁面變成高质量,但它能帮助判断頁面主题是否和連結上下文一致。当内鏈锚文本、頁面标题和 URL 里的词彼此矛盾时,反而會给归類增加噪音。
更現實的影响在于稳定性。URL 一旦被收錄並被引用,就變成一份長期契约,改一次就要付一次重定向和重新抓取的成本。
几種常见的命名方式
- 數字 ID(/article/10231):稳定,不會因為标题修改而變化,但無法從 URL 讀出主题,内鏈和分享场景下可讀性差。
- 拼音或英文 slug(/wangzhan-shoulu):可讀,但要避免把标题整句塞進去,過長且容易堆词。
- 中文 slug:浏览器里看着正常,實际會被编碼成一長串百分号字符,複製、日誌分析和手工核對都更麻烦。
- 日期目錄(/2024/06/xxx):适合新闻归档,不适合長期更新的教程類内容,跨年改版时容易出現新舊路径並存。
哪些做法容易埋下收錄隐患
同一頁面換過多次 URL
早期用 ID,中期換成拼音,後期又想加目錄层級。每一次改動都會留下一批舊地址。如果重定向鏈條過長,或者部分舊地址没有做 301,就會出現多個 URL 指向同一内容,把本该集中在一處的信号拆散。
slug 里塞满關鍵詞
把标题拼接成 /shouji-shoulu-zenmeban-shoulu-jiaocheng-2024 這類長串,並不會提高相關性,只會让連結更难複製和引用。命名点到主题即可,细节交给标题和正文。
大小寫、下划线與尾斜杠混用
部分服務器會把 /Page 和 /page 当成不同地址,下划线和短横线在不同系統里也可能产生歧义。站内统一一種寫法,比事後靠重定向收拾更省事。
可以照着执行的几條規則
- 先定结构再定内容:栏目用目錄,條目用 slug,层級尽量控制在两到三层。
- 只用小寫字母、數字和短横线,避免中文、空格、下划线和大寫字母。
- slug 長度控制在三到六個词,去掉 the、and、的、了這類無意义的词。
- 發布前確認一次 URL,發布後尽量不要改;必须改时用 301 指向新地址,並更新站内所有内鏈。
- 保留舊 URL 的重定向记錄,定期抽查是否仍能正常跳轉。
URL 命名不是收錄的開關。它更像地基:做得好时没人注意,做得乱时,問题會在改版、迁移和日誌排查时集中冒出来。
如果站点已经有大量命名混乱的歷史 URL,不必一次性全部改掉。優先處理那些有稳定流量、有外鏈,或者正反复出現在抓取日誌里的頁面,其余保持現状即可。收錄的核心仍然是内容质量和站内结构,URL 只是让這两件事更容易被讀懂。