有时候在搜尋结果里看到的摘要很奇怪:不是頁面開头的正文,而是一串導航词、栏目名、頁脚說明,甚至是“点击查看更多”“版權所有”。這不一定代表搜尋蜘蛛没抓這個頁面——URL 检查里可能顯示已经抓取、也已经编入索引。問题出在它讀到的那份内容里,你真正希望被引用的那几段文字並不在其中。
摘要通常由索引里的内容生成
摘要一般是搜尋系統根據索引中儲存的頁面内容自動截取的,不是一個可以逐字指定的字段。meta description 有时會被參考,但頁面正文本身更常被当作来源。所以当正文没有進入索引内容、或者進入的比例太小,系統能挑選的只剩導航、菜單、頁脚這類模板文本,结果就顯得“不像這篇文章”。
正文没被讀到的几種常见情况
- 關键内容以图片形式呈現,既没有可讀文本,也没有替代文字。抓取端讀到的是图片标簽,不是图里的句子。
- 正文由前端脚本在浏览器端拼出来,而較早阶段的抓取只拿到一個空容器。渲染阶段如果没有覆盖到,索引里就是空壳。
- 首屏只有一句引導语,主要内容藏在“展開全文”“查看詳情”之後,需要交互才出現。
- 正文放在 tab、折叠面板或轮播里,預設不展示,文本虽然在頁面结构中,但可讀性很差。
- 正文以 PDF、附件下载或需要登入才能查看的形式存在,抓取端看到的是提示文字。
- 模板文字占比過高,推荐阅讀、相關文章标题层层堆叠,正文被稀释。
怎么確認搜尋蜘蛛實际讀到了什么
- 用 URL 检查類工具查看“抓取的頁面”原始 HTML,而不是只看自己浏览器里渲染之後的效果。
- 在浏览器里關閉或限制脚本後再打開頁面,看正文是否還在。
- 對比该 URL 在搜尋蜘蛛日誌里的响應字节數與同類正常頁面。字节數明顯偏小,往往意味着拿到的是壳。
- 把頁面文本複製到纯文本編輯器里,看看标题、正文、導航各占多少比例。
- 換几個同類頁面重复上述步骤。如果問题出現在模板层面,通常整站同類頁面表現一致。
把正文交到抓取端能看到的地方
- 關键信息用 HTML 文本直接寫在頁面里,图片作為补充,而不是唯一载体。
- 图片配上描述清楚的 alt,让图片承担的信息至少能被讀成文字。
- 折叠面板、tab 里的内容,尽量在預設狀態下也存在于 HTML 中,交互只影响展示,不影响可讀。
- 正文尽量靠前,模板化的推荐模块和相關連結放到正文之後,减少對正文的稀释。
- 如果内容必须依赖脚本渲染,確認渲染鏈路稳定,不要出現抓取端偶尔拿到空壳的情况。
- 不用為了摘要去堆關键字。摘要是否采用、怎么截取,最终由搜尋系統判断。
抓取到、编入索引、在搜尋结果里被引用,是三件不同的事。摘要不好看时,先確認中間那一环——索引里到底存了多少你的正文,比反复琢磨摘要文案更實际。