原始 HTML 可用性

AI 就緒度 · 有證據支持

本頁為英文版的中文翻譯,僅供參考。如中英文版本有任何歧義,概以英文版為準。

這項檢查會在你的頁面上讀什麼

這裡數的,是伺服器回傳的 HTML 裡、JavaScript 還沒跑就已經在的字。約 525 個讀得到的字就滿分;不到的話照曲線遞減,最前面的字給分最多,整個回應沒有可見文字就是零分。要是頁面得等 Kuroma 退而改用完整瀏覽器才吐得出內容,不管是內容靠 script 渲染,還是被 bot 防護牆擋住,分數都會接近最低,因為 AI 爬蟲不用瀏覽器。

我們對證據的判定

有證據支持沒有任何主要的 AI 爬蟲會執行 JavaScript,因此只有在腳本執行後才出現的內容,對 AI 搜尋而言是看不見的。這是本次檢測中證據最充分的技術發現之一。

Vercel and MERJ AI crawler study (569M GPTBot requests: zero JavaScript execution, no image fetches)

其他因子評的都是瀏覽器渲染後的頁面,只有這一項描述的是爬蟲實際拿到什麼:算進去的字就是 AI 爬蟲拿到的字,靠用戶端元件渲染出來的內容,一個字都到不了它手上。哪些字重要,這裡分不出來,一頁伺服器端渲染的樣板文字,和一篇伺服器端渲染的文章拿一樣的分;它只能告訴你頁面上到底有沒有東西。這裡的低分要最先修,因為它說的是 AI 爬蟲究竟拿到了那一頁的多少。

值多少分

佔「AI 就緒度」的 5%,相當於總分 100 分裡的 1.5 分。

受檢頁面在這一項的表現

依據 30,738 個受檢頁面。

中位數頁面得 100 分,中間一半的頁面落在 57 到 100 分之間。

  • 良好(75 到 100)21,802 (71%)
  • 普通(50 到 74)1,635 (5%)
  • 待加強(25 到 49)947 (3%)
  • 嚴重不足(0 到 24)6,354 (21%)

24% 的受檢頁面在這一項低於 50 分。

哪些產業最常不及格、哪些最少

最常不及格的產業

最少不及格的產業

該怎麼修

  • 主要內容在伺服器端渲染,直接放進 HTML 回應裡;用戶端的 hydration 只當補強。
  • 用 curl 看看這一頁回傳什麼;內容只是一個 script 外殼的話,AI 爬蟲看到的就是那樣。
  • 讓已知的 AI 搜尋爬蟲通過 bot 防護牆,拿到和瀏覽器一樣的 HTML。
  • 伺服器端渲染的內容至少留約 525 個真正的字。

這個因子改過什麼

有 5 個版本的變更無法對應到個別因子,所以其中任何一個都可能更動過這個因子;完整的變更紀錄裡有它們。

其他因子

全部因子,以及分數是怎麼算出來的