很多站点把面包屑導航当成视觉装饰:一行灰色小字,放在标题上方,用戶很少点,运营也很少管。但從抓取角度看,面包屑是一條稳定的向上内鏈通道,它告诉蜘蛛「這個頁面属于哪個栏目、上面還有几层」。如果這條通道寫错了,蜘蛛對站点的层級理解就會跟着歪。
面包屑到底在替谁说话
對用戶来说,面包屑回答的是「我在哪、怎么回去」;對蜘蛛来说,它回答的是「這個頁面在站点结构里的位置」。這两個答案應当一致。常见的情况是:面包屑寫着「首頁 > 资讯 > 行业動態」,但頁面實际 URL 挂在 /news/2024/ 下,栏目頁又是另一個路径,蜘蛛拿到的层級信息和 URL 路径互相打架,只能自己猜。
常见問题清單
- 不可点击:面包屑用 span 加 JS 跳轉,或者干脆是纯文本。蜘蛛拿不到連結,這條向上路径等于不存在。
- 层級跳級:從首頁直接跳到最末級分類,中間层被省略,蜘蛛無法顺着它發現中間栏目頁。
- 层數過長:七八层叠下来,用戶不看、蜘蛛也难判断哪一层才是主要归属,一般控制在三到五层以内更清晰。
- 指向參數頁或篩選頁:面包屑里混入带排序、篩選參數的地址,容易把蜘蛛引向大量相似頁面。
- 锚文本不统一:同一個栏目,有的頁面寫「行业動態」,有的寫「行业资讯」,還有的寫「最新行业動態」,蜘蛛會当成不同對象。
- 與结构化資料不一致:頁面上顯示的是 A 路径,BreadcrumbList 里寫的是 B 路径,两邊對不上。
- 面包屑對不上主導航:主導航里没有這個栏目,面包屑里却出現,說明栏目規划本身可能有遗漏。
可以照着做的自查步骤
- 挑十個不同類型的頁面(首頁、栏目頁、内容頁、标簽頁),逐個查看面包屑的 HTML 輸出,確認每一层都是真實的 a 标簽,href 可直接訪問。
- 把面包屑的每一层地址複製出来,用浏览器無痕模式打開,確認返回 200,且與頁面所属栏目一致,不是跳轉或者 404。
- 對照 URL 路径、主導航、内鏈锚文本,看三處對同一個栏目的叫法是否统一。不统一就以栏目頁标题為准,逐處改齐。
- 检查 BreadcrumbList 结构化資料,名稱、顺序、連結都要和頁面上可见的面包屑一致,不要多寫一层或少寫一层。
- 關掉 JS 再看一次頁面源碼,確認面包屑不是靠脚本渲染出来的。如果必须由 JS 生成,至少保證服務端輸出一份基础结构。
- 移動端折叠或横向滚動时,確認折叠只是视觉處理,HTML 里该有的連結一個都没少。
和栏目規划、内鏈一起看
面包屑的問题往往不是孤立的技術問题,而是栏目規划的投影。如果某個栏目長期没有栏目頁,只能靠列表頁承载,面包屑里就會出現一個点不進去的死层;如果一篇文章同时属于三個栏目,面包屑只能選一條主路径,其余的靠标簽和内鏈补足。建议每個季度把面包屑的层級和實际栏目树對一遍,删掉已经不用的栏目,补上新增但没進面包屑的栏目。
面包屑不是装饰线,而是站点结构的缩略图。它寫對了,用戶少迷路,蜘蛛少猜测;它寫错了,頁面再優质也可能被归错门類。
這類自查不需要复杂工具,打開頁面看源碼、点一遍連結,就能發現大部分問题。把它纳入上线前的常規检查,比事後追着日誌找原因省事得多。