網站收錄

URL 里该放什么:slug 命名對發現、抓取與收錄的實际影响

URL 是爬虫看到頁面的第一段文本。本文說明 slug 命名對發現與去重的影响,對比數字 ID、拼音、中文和日期目錄几種方式,指出換址、關鍵詞堆砌、大小寫混用等常见隐患,並给出统一的命名規則與改址處理建议。

網站收錄

URL 里该放什么:slug 命名對發現、抓取與收錄的實际影响

URL 是頁面在站内的唯一标识,也是爬虫最先看到的一段文本。它不會直接决定頁面能不能被收錄,但會影响發現效率、去重判断和後續的维護成本。很多收錄問题回头看,源头只是一個命名混乱的連結。

slug 會被爬虫当作什么信号

爬虫處理一條新連結时,URL 本身能提供的信息很有限:域名、目錄结构、參數,以及一段可讀的词。這段词不會让低质量頁面變成高质量,但它能帮助判断頁面主题是否和連結上下文一致。当内鏈锚文本、頁面标题和 URL 里的词彼此矛盾时,反而會给归類增加噪音。

更現實的影响在于稳定性。URL 一旦被收錄並被引用,就變成一份長期契约,改一次就要付一次重定向和重新抓取的成本。

几種常见的命名方式

  • 數字 ID(/article/10231):稳定,不會因為标题修改而變化,但無法從 URL 讀出主题,内鏈和分享场景下可讀性差。
  • 拼音或英文 slug(/wangzhan-shoulu):可讀,但要避免把标题整句塞進去,過長且容易堆词。
  • 中文 slug:浏览器里看着正常,實际會被编碼成一長串百分号字符,複製、日誌分析和手工核對都更麻烦。
  • 日期目錄(/2024/06/xxx):适合新闻归档,不适合長期更新的教程類内容,跨年改版时容易出現新舊路径並存。

哪些做法容易埋下收錄隐患

同一頁面換過多次 URL

早期用 ID,中期換成拼音,後期又想加目錄层級。每一次改動都會留下一批舊地址。如果重定向鏈條過長,或者部分舊地址没有做 301,就會出現多個 URL 指向同一内容,把本该集中在一處的信号拆散。

slug 里塞满關鍵詞

把标题拼接成 /shouji-shoulu-zenmeban-shoulu-jiaocheng-2024 這類長串,並不會提高相關性,只會让連結更难複製和引用。命名点到主题即可,细节交给标题和正文。

大小寫、下划线與尾斜杠混用

部分服務器會把 /Page 和 /page 当成不同地址,下划线和短横线在不同系統里也可能产生歧义。站内统一一種寫法,比事後靠重定向收拾更省事。

可以照着执行的几條規則

  1. 先定结构再定内容:栏目用目錄,條目用 slug,层級尽量控制在两到三层。
  2. 只用小寫字母、數字和短横线,避免中文、空格、下划线和大寫字母。
  3. slug 長度控制在三到六個词,去掉 the、and、的、了這類無意义的词。
  4. 發布前確認一次 URL,發布後尽量不要改;必须改时用 301 指向新地址,並更新站内所有内鏈。
  5. 保留舊 URL 的重定向记錄,定期抽查是否仍能正常跳轉。
URL 命名不是收錄的開關。它更像地基:做得好时没人注意,做得乱时,問题會在改版、迁移和日誌排查时集中冒出来。

如果站点已经有大量命名混乱的歷史 URL,不必一次性全部改掉。優先處理那些有稳定流量、有外鏈,或者正反复出現在抓取日誌里的頁面,其余保持現状即可。收錄的核心仍然是内容质量和站内结构,URL 只是让這两件事更容易被讀懂。