Kuroma 如何評分 AI 就緒度
AI 就緒度是幫你自己的網站打的分數,滿分 100 分。到免費 AI 就緒度檢測輸入網址,大約一分鐘就會拿到分數,不用開帳號,也不用信用卡。
這個分數只衡量一件事:AI 引擎要抓到你的頁面、從裡面取出一段乾淨的答案、再把它引用出去,到底有多容易。為什麼這件事重要?因為你的客戶問問題的地方變了。一則 AI 答案只會列出少數幾個來源,其他全部略過。當它提到競爭對手,卻沒有提到你,原因通常比你想的無聊:引擎讀得懂對手的頁面,從你的頁面裡卻抓不出可以直接用的答案。而且不會有任何人通知你。這個分數要指出來的,就是你自己網站上擋住它的那些地方。
一個分數、4 個類別、19 個因子;因子指的就是我們在頁面上看的其中一件事。每一個因子都公開在下方,連同它的權重、我們對證據的判定,以及我們依據的研究連結。
分數旁邊那個英文字母代表什麼?
那個字母就是你的等第。等第完全由那個 0 到 100 的分數決定,不會另外加減什麼,而且每次檢測都用同一組區間。
| 等第 | 分數 | 代表的意思 |
|---|---|---|
| A+ | 73 到 100 | 很好,這個頁面對 AI 搜尋的能見度已經優化得相當到位。 |
| A | 58 到 72 | 表現不錯,這個頁面優化得很好,還有一些小地方可以再調整。 |
| B | 50 到 57 | 底子不錯。照著建議做下去,能見度還有明顯的提升空間。 |
| C | 43 到 49 | 還有進步空間。先從高優先度的建議開始處理。 |
| D | 35 到 42 | 需要花點工夫。有幾個地方得先處理,AI 能見度才會變好。 |
| F | 0 到 34 | 需要大幅改善。請從最關鍵的那幾項建議開始。 |
你該如何解讀這項分數?
這項分數衡量的是引用就緒度,而非預測流量。AI 答案具有機率性:相同的問題在每次執行間會產生不同的引用組合,因此沒有任何單一數字能保證被引用的位置。就緒度會提高勝算;接著 Kuroma 的能見度掃描會跨引擎衡量結果,兩者合起來便能告訴你該修正什麼、以及是否見效。
這一頁有兩種讀法。讀到這裡是簡短版,拿來動手已經夠用。下面全部是背後的證據:每一個因子值多少,以及這個分數預測真實 AI 引用的表現如何。下面每一段開頭都會先用白話講一句,你可以在任何一層停下來。我們沒有把任何東西留到業務會議才講。
為什麼這些你都查得到。本頁是由評分引擎實際執行的同一份定義所產生的,因此你在這裡讀到的內容,正是我們實際推出的版本。這對你是有意義的:當別的工具說你的分數從 71 掉到 64,你無從判斷是自己的網站變了,還是他們的模型變了。在這裡你判斷得出來;你找懂的人來幫你檢查我們有沒有做到,也可以。
評分準則版本 2026-08-13。先前每一個版本都列在下面,包含改了什麼、什麼時候改的。
以觀測到的 AI 答案進行驗證
先用白話講一次:我們把這個分數拿去跟真實情況對答案。做法是先看各品牌原本的分數,再看接下來那幾週 AI 引擎實際上有沒有引用他們。計算過程只看得到前面的週次,後面的週次等於是真正的考題。下面這張表的判讀方式是:0.50 代表這個分數排出來的順序跟擲硬幣沒有兩樣,1.00 代表排序完全正確。表上沒有任何一個數字是網站分數。關於這張表本身,有一點要先說明:這些數字是用我們在 2026 年 8 月 9 日之前所使用的評分版本測出來的。那一天我們修正了十九個評分項目裡十一個的缺陷,所以那個日期前後的分數並不能互相比較,而這項驗證還沒有在修正後的版本上重跑過。它也沒辦法很快重跑:這項測試比較的是我們事先的預測,與接下來幾週 AI 引擎實際的行為,因此必須先累積好幾週在同一套修正後評分下的結果,才有東西可以誠實地計算。那些週次正在累積中,無論新的數字往哪個方向走,我們都會公布。
我們以每個品牌在那些答案產生之前所持有的檢測因子分數,對我們自家能見度掃描所觀測到的引用結果(在 22 週間蒐集的 201,695 筆 AI 答案)進行迴歸分析。驗證採用嚴格時間切分的樣本外方式:模型以較早的週次配適,並且僅在它從未看過的較晚週次上評分。所用指標為 AUC,也就是模型將被引用案例排在未被引用案例之上的機率;0.5 代表不比隨機猜測更好,1.0 代表完美排序。
| 引擎 | 保留樣本 AUC(較晚的週次,訓練時從未見過) |
|---|---|
| ChatGPT | 0.84 |
| Grok | 0.76 |
| Claude | 0.68 |
| Google AI Overviews | 0.63 |
| Perplexity | 0.61 |
| Google AI Mode | 0.61 |
| 引擎 | 保留樣本 AUC(較晚的週次,訓練時從未見過) |
|---|---|
| Claude | 0.83 |
| Google AI Overviews | 0.52 |
| Perplexity | 0.44 |
| ChatGPT | 0.38 |
| Grok | 0.33 |
| Google AI Mode | 0.30 |
語料庫:201,695 筆 AI 答案、869,783 筆擷取出的引用、22 週,驗證於 2026-07-07。受測品牌群:17 個品牌。
基於一個誠實的理由,Gemini 未列入此表:在我們的整個語料庫中,它幾乎從不引用品牌自己的網域(它反而引用零售商、媒體與評論網站),因此「品牌的網域是否被引用」對它而言是不適合用來評分的指標。我們正在為它建立一個第三方報導的標記。
這場檢驗不能證明的事。
- 這兩張表請一起看,不要分開看。它們是同一支程式、在同一段期間跑出來的,而在較早的那一組裡,六個引擎中有四個的分數低於 0.5,也就是比隨機猜測還差。我們把它一併公布,因為一個只在對自己有利時才拿出來的數字,稱不上是證據。
- 留作測試的資料分別只有 5 列與 4 列。這個量小到兩張表都不足以定論:用 5 筆觀測算出來的 AUC,既可能來自一個很好的模型,也可能來自根本沒有預測力的模型。請把它們當成第一次探測,而不是已完成的驗證結果。
- AUC 衡量的是整組因子作為整體的排序能力。它並不允許對任何單一因子提出因果主張,我們也不會依這些係數重新調整評分準則的權重。
- 經過驗證的檢測來自 2026 年 3 月至 6 月的引擎,目前的評分準則沿用了它的衡量核心,並依證據重新調整權重。目前的評分準則會在每個掃描週次累積屬於自己的受測品牌群。
- 此切分驗證的是針對模型已看過的品牌、跨時間的預測,而非針對它從未看過的品牌類型的預測。這兩組受測品牌分別為 17 個與 10 個品牌;隨著它們成長,我們會發布更新後的數字。
這 19 個因子。下面每一個類別各佔總分的一部分,每一個因子再各佔所屬類別的一部分。表格裡的「狀態」,寫的是我們對這個因子「證據強度」的判定,不是對你網站的判定。另外,其中一個類別的名稱也叫「AI 就緒度」,跟整個分數同名。那一個類別只是分數的一部分,不是整個分數:它問的是引擎拿到頁面之後,這一頁有多值得被引用,下面它自己那一段會列出裡面有哪些因子。整個分數則是 4 個類別合起來的結果。
以下每一個因子都附有一項判定與其背後的研究:在有對照研究之處採用對照研究,在沒有之處採用大規模觀測資料,在廠商已表態之處採用官方平台指引。當證據顯示某個熱門手法無效時,我們會調降其權重並如實說明。
頁面內容:佔總分的 25%
這一類問的是:頁面講得夠不夠深、有沒有真的回答別人會問的問題,還有版面是不是機器好取用的樣子,例如表格與清單、白話的文字、真正的標題階層,而不是把重點封在圖片裡。
技術優化:佔總分的 20%
這一類幾乎只有一個問題:AI 引擎到底抓不抓得到這個頁面,還是被擋住、壞掉,或慢到抓不完。
權威訊號:佔總分的 25%
這一類看的是頁面本身能證明誰為它背書:有沒有連到真正的資料來源、有沒有聯絡方式與隱私權政策這類讓網站看起來站得住腳的基本資訊,以及有沒有具名作者和日期。
| 因子 | 類別內權重 | 狀態 | 原因(附證據) |
|---|---|---|---|
| 外部引用與參考來源 | 36% | 刻意調降權重 | 引用來源在對照沙盒實驗中有幫助,但在競爭性的重複實驗中,效果會縮減趨近於零,因此相關主張有所設限,權重在該類別中維持適中。 GEO: Generative Engine Optimization (arXiv 2311.09735) |
| 信任與品牌訊號 | 36% | 刻意調降權重 | 頁面上的信任標章作為一個類別尚未經過測試;有證據支持的信任管道是站外評論。保留是為了發布者的可課責性(這個網站由誰發布,並以機器可讀的方式標示),以及聯絡管道與已公開政策等基本正當性訊號。 Cross-engine citation-driver study, deep vs shallow content and freshness gatekeeping (arXiv 2605.25517) |
| E-E-A-T 訊號 | 28% | 依證據重新界定範圍 | 沒有研究將作者簡介當作 AI 引用的因果槓桿來測試;真正的權威度管道是站外品牌足跡。頁面上的署名與日期以最佳實務基本功的形式,以較低權重保留。 Cross-engine citation-driver study, deep vs shallow content and freshness gatekeeping (arXiv 2605.25517) · Google Search Central guidance on AI features (no special schema needed, no ideal page length) |
AI 就緒度:佔總分的 30%
這一類看的是引擎拿到頁面之後,這一頁有多值得被引用:有沒有讀者可以查證的數據、段落能不能獨立看懂、日期夠不夠新、有沒有講到別人沒講的東西、原始碼是不是用機器讀得懂的方式寫的,以及文字是不是不用跑 JavaScript 就讀得到。
我們刻意不評分的項目
這些項目在許多 AI 能見度檢測裡都會被評分。目前最好的證據顯示它們並不會影響 AI 引用,因此為它們評分只會膨脹那些沒有回報的工作。
| 未評分 | 為何不評分(附證據) |
|---|---|
| llms.txt | 三重落空:絕大多數的 llms.txt 檔案收到零筆爬蟲請求,Google 表示會忽略它們,而且沒有任何主要引擎會為了引用而讀取它們。僅偵測並以資訊性方式回報。 Google Search Central guidance on AI features (no special schema needed, no ideal page length) · Vercel and MERJ AI crawler study (569M GPTBot requests: zero JavaScript execution, no image fetches) |
| 將 Schema 標記作為 AI 引用槓桿 | 一項大型對照測試發現,加入 schema.org 標記並未提升 AI 引用,而 Google 表示 AI 功能不需要特殊的結構化資料。Schema 的計分近乎為零,僅適用於傳統複合式搜尋結果(rich results)與 Bing grounding。 Ahrefs controlled schema test (1,885 treated pages vs matched controls) · Google Search Central guidance on AI features (no special schema needed, no ideal page length) |
| 逐次執行的 AI 排名追蹤 | 單次執行的 AI 答案在統計上並不穩定(同一天的相同查詢,其引用只有幾個百分比的時候會一致),因此逐次執行的排名只是雜訊。Kuroma 改為呈現多次重複執行的提及率。 Cross-engine citation-driver study, deep vs shallow content and freshness gatekeeping (arXiv 2605.25517) |
| 關鍵字密度優化 | 關鍵字堆砌的測試結果,對 AI 搜尋引擎的引用呈因果性負向,且在傳統搜尋中已失效多年。本次檢測中沒有任何項目會獎勵它。 GEO: Generative Engine Optimization (arXiv 2311.09735) |
這份評分準則的每一個版本,以及改了什麼
一個分數要能拿來看長期變化,前提是你知道尺什麼時候換過。下面依時間由新到舊列出這份評分準則的每一個版本,說明改了什麼、為什麼改,以及有沒有讓誰的分數變動。只要某一版讓分數變動了,那一版前後的兩個分數就不是在量同一件事,我們會直接講明,而不是讓你自己去猜。
這份歷程是在 2026-08-07 依據我們的變更紀錄與內部規格文件整理出來的,並不是每次改動當下就寫下來的。清單最後面那幾版早於本頁所依據的共用定義,因此各自附上了一段說明,交代它是依據什麼重建的。
評分準則版本 2026-08-13,目前使用中
改了什麼。「答案框潛力」不再因為你的頁面上有清單而給分,改為量測這個項目名稱真正指的那件事。 它過去會把整整五分之一的分數,發給「有一個有序清單,或兩個無序清單,或頁面上任何地方有三個清單項目」。現在它找的是「段落」:一個說明這一段在講什麼的標題,後面接著一段能自成一體回答它、而且到此為止的文字。長到足以構成一個答案,短到可以被整段引用,而且是由文字構成,不是由連結構成。這個問題會被問兩次,因為那是兩個不同的問題:以你這個長度的頁面來說,這樣的段落夠不夠多;以及你的標題大多是開啟一個段落,還是大多只是掛在連結上的標籤。 原本的另外三項都還在。定義改用曲線計分,不再在 1 個與 3 個的地方跳動。問答區塊的配分減半,因為「問題涵蓋度」這個項目已經在評分同樣的 FAQ 標記與同樣的問句標題,同一件事不該用全額計價兩次。表格、定義清單與步驟標記的配分同樣減半,因為 89% 的首頁根本沒有這些東西,在原本的價碼下,那不是在描述一個頁面,而是一筆固定的扣分。 「內容新鮮度」也調整了,而且它影響的頁面比上面六項都多:200 個中有 76 個。分成兩個修正。 第一,它現在讀得懂韓文寫法的日期。原本的比對規則收得了日文和中文的「年」「月」,卻收不了韓文的「년」「월」,所以一個用自己語言標示日期的韓文頁面,會被判定成完全沒有日期。有一個韓國新聞首頁,舊規則唯一找得到的日期是報頭裡的登記日期,2012 年,於是我們把一個當天早上發布的頁面判成十四年前,給了 41 分而不是 79 分。現在會跳過登記日期那一行,因為不論哪一種語言,登記日期都不是發布日期。 第二個修正讓更多頁面拿到零分,從 45 個增加到 67 個,這是這個項目正常運作的結果,不是壞掉。那 67 個裡面,有 49 個在讀者看得到的地方完全沒有寫出近期年份;另外 18 個,每一個近期年份都出現在頁尾的著作權宣告裡。著作權那一行是每次載入頁面時由樣板自動產生的,它並不能說明上面那些內容是什麼時候寫的。為這件事給 30 分,等於讓一個完全沒有交代新鮮度的網站,和一個有交代的網站拿到一樣的分數。如果您的頁面有寫出撰寫或更新的時間,四種語言都可以,現在就會拿到分數;如果沒有,就是零分,而這個零分是誠實的。 「E-E-A-T 訊號」多了兩種可以取得權威分數的方式,而這會讓某些頁面在完全沒有改動的情況下分數變低。這一項請仔細看,因為方向和直覺相反。 這個項目的權威部分原本只有 10 分,而且幾乎沒有東西可以量。現在它看得到兩件以前看不到的事:一個從您的組織連向其他官方檔案的機器可讀連結,以及一個連向公開登記資料的連結。這兩件事,真實存在的公司通常拿得出來,虛構的公司通常拿不出來,而這正是這個項目存在的理由。權威部分因此從 10 分變成 25 分。 因為量尺變長了,一個兩種訊號都沒有的頁面,現在是用一個更大的總分去衡量,所以即使頁面完全沒變、也沒有變差,分數還是會下降。這是同一個答案放在更嚴格的尺上量出來的結果。如果貴組織有發布這些連結,您會加分;如果沒有,這會是整份報告裡最值得優先處理的一項。 有一個不對稱,我們寧願自己先說。那個機器可讀的官方檔案連結,出現在我們量測的英文頁面中的 56%,但在中文、日文、韓文頁面中只有 34%,所以受到這次調整影響而下降的非英文頁面,會比英文頁面多。這反映的是目前各地網站實際發布內容的差異,不是我們對這些網站的評價,而且這個落差補起來並不困難。
為什麼改。我們在 200 個真實頁面上量測這個項目實際做了什麼,結果其中三分之一拿到完全一樣的分數:20 分。原因就是清單那一層。典型的首頁帶有 13 個無序清單與 86 個清單項目,而其中絕大多數是導覽選單、頁尾與卡片區塊。於是一個名為「答案框潛力」的項目,最主要的行為竟然是因為你有選單而加分,而且不論頁面實際寫了什麼,88.6% 的首頁分數都在 50 以下。 當三分之一的網路都落在同一個數字上,這個項目就無法分辨好頁面與壞頁面,而那正是它唯一的工作。這個項目公開的評分機制一直都是「段落能否自成一體」,但過去沒有任何一部分在量測它。 清單那一層是被移除,而不是被修好。清單要有幫助,前提是它的項目有講出內容;而項目有講出內容的清單,本來就已經被算進它所在的那個段落裡。實測顯示,帶有 8 個字以上、且不是連結文字的清單項目,只存在於 11% 的首頁上,所以修好後的清單層會變成第四個幾乎沒人搆得到的層級,那是問題本身,不是解法。
分數有變動嗎?有,這個日期之前與之後的分數無法互相比較。在 200 個凍結頁面上,有 181 個移動了:128 個往上、53 個往下,這個項目平均變動 9.1 分,換算到總分約為 0.66 分。 重點在於大幅移動的方向。一個帶有 142 個標題、卻沒有任何一段可供引用的新聞首頁,從 63 分掉到 33 分。原本 0 分的 cloudflare.com 升到 48 分,因為它有九個可引用段落,過去從未被計入。在我們作為參照的世界級首頁集合中,平均分數從 24 升到 51,分數低於 50 的頁面從 11 個中的 10 個降到 11 個中的 5 個。 底部沒有太大變動,而這是刻意的。在我們標記為體質不佳的頁面中,仍有 89% 分數低於 50,57% 仍是 0 分。一個沒有標題、或標題底下只有連結的頁面,本來就不是一個答案框,也不會被當成答案框來評分。
評分準則版本 2026-08-11
改了什麼。可讀性這一項現在是靠讀懂頁面來找出你的段落,而不是去找某一個特定的 HTML 標籤。它問的問題和以前完全一樣:你有多少比例的段落,短到足以讓 AI 助理整段引用。差別在於,現在只要是帶有完整句子的一塊文字,就算是一個段落。標題不算,整塊幾乎都是連結的區塊也不算,因為這兩者都不是段落。配分沒有任何變動,這個因子在可讀性的 100 分裡,依然佔 35 分。
為什麼改。可讀性是拿你的短段落數量去除以總段落數量,而它是靠尋找 <p> 標籤來計算段落的。如果一個網站是用 <div> 來排版內文,頁面上根本沒有任何 <p>,這個除法就沒有分母可用。一個未定義的答案被當成 0 來讀,而 0 是這條曲線上最差的結果,於是我們評分過的所有頁面中,有 12.8% 因為我們其實從未真正讀取的內文而被扣分。其中一個診所網站,在 324 個句子、3,674 個字的內容上只拿到 35 分。 最直覺的修法,也就是在無法評估時直接把這部分拿掉、再把其餘配分等比放大,我們實作、測試之後把它整個丟棄了,因為那樣會變成:一個網站只要刪掉自己的段落標籤,就能多拿 19 分。少評一項,永遠都是在偏袒那些本來會在那一項上不及格的頁面。唯一誠實的做法,是真正去量測這個因子名稱上所寫的那個東西。
分數有變動嗎?有,這也正是今天之前與之後的分數無法互相比較的原因。在 396 個真實頁面上量測,可讀性在其中 27.8% 的頁面上移動了:75 個往上,35 個往下,最大幅度達 35 分。有使用 <p> 的頁面也可能移動,因為這些頁面往往在其他區塊裡也寫了內文,而那些內文現在同樣被計入。對總分的影響很小,全體平均約為 0.04 分,因此昨天設定的等第界線維持原樣,完全沒有調整。
版本 2026-08-10 內的一次修正,2026-08-10
改了什麼。每個等第所對應的起始分數調整了。A+ 從 75 分降到 73 分,A 從 68 分降到 58 分,B 從 62 分降到 50 分,C 從 55 分降到 43 分,D 從 45 分降到 35 分。沒有任何分數改變,十九個評分項目與它們的權重也都沒有變。
為什麼改。同一天稍早重寫的那兩個項目,讓每一個受檢網站的分數都下降了大約 11 分。如果等第界線不動,先前的界線會把 70% 的已公開網站評為 F,而這正是兩天前設定這些界線時要解決的問題:當時沿用的學校式評分階梯讓 47% 的網站不及格,而且從來沒有給出過任何一個 A。 在這兩次設定之間保持不變的,是各等第所佔的比例,而不是那些數字。數字描述的是量測工具,比例描述的是這個網路世界。當工具改變時,數字就必須跟著移動,這樣描述才不會跟著走樣。
分數有變動嗎?沒有。沒有任何一個分數改變,這則紀錄前後的分數可以直接互相比較,因為等第只是貼在一個本來就存在的數字上的標籤。今天確實有許多網站看到不同的等第,但那是稍早那次重寫讓它們的分數移動了,不是這次調整造成的。在目前這一代評分下的 583 個網站上量測,等第分布為 A+ 0.5%、A 3.4%、B 11.8%、C 23.5%、D 28.8%、F 31.9%,與先前設定所產生的形狀相差不到一個百分點。
評分準則版本 2026-08-10
改了什麼。十九個評分項目裡有兩項被重寫了,而且它們一起上線,因為其中任何一項單獨變動,都會迫使全體網站重新評分一次。 「這個頁面有沒有說出別人說不出來的東西」這一項,現在讀得懂任何語言的頁面。它原本只找英文的字詞,像是 the only、unlike、case study、our methodology,而且只要一個段落不是以拉丁字母為主,它就直接拒讀,因此在中文、日文、韓文頁面上根本沒有東西可以評,這一項也就被整個排除掉。現在它找的是一個頁面唯有真的懂自己的題目才寫得出來的東西,而這些東西在每一種語言裡長得都一樣:帶有單位、價格或百分比符號的數據;同一個段落裡並列的兩個數據,也就是讀者可以自行查核的比較;頁面總共用到幾種不同類型的數據;以及頁面直接寫出來的版本、型號與標準。現在重要的是整個頁面有多少比例帶著數據,而不是數據的絕對數量,所以一個很長的頁面不再只因為長就得分。 「AI 爬蟲能不能讀到並用得上這個頁面」這一項,則是圍繞著爬蟲實際上能對這個頁面做什麼重新設計。它原本把大部分配分給幾乎每個網站本來就有的東西:安全連線、文件類型宣告、字元編碼宣告、robots.txt 檔案存在與否。而封鎖 AI 搜尋引擎只被當成固定扣分,因此一個把三分之一可能引用它的引擎擋在門外的網站,只掉幾分,等第通常還是一樣。現在存取權限是整項的乘數:擋掉三分之一的引擎,這一項就少掉三分之一;而標示 noindex 的頁面直接得 0 分,不論它做得多好,因為一個被排除在 AI 答案所依據的索引之外的頁面,根本無法透過那些索引被找到。剩下的配分則用來衡量它往同一個網站的其他頁面開出了幾條不同的路徑,以及它的連結有多少比例是爬蟲真的跟得下去的,而不是選單裡的佔位連結。安全連線不再計分,因為每個受檢網站都有,一個人人都拿得到的分數說明不了任何事。
為什麼改。這兩項都已經無法分辨網站之間的差別,而這是我們直接量測出來的。在同一批 200 個真實頁面上,獨特性那一項給了 91% 的繁體中文頁面同一個分數,韓文頁面則是 93%,也就是說它在這些市場裡根本分不出兩個網站有什麼不同。把它在這些頁面上排除掉並沒有解決問題,那只是讓中文、日文、韓文網站在這一塊完全得不到任何回饋。爬蟲那一項更嚴重,因為它影響所有人:它把 96% 的頁面放進同一個等第區間,而 30 個日文頁面則是每一個都在同一個區間裡。它是整份檢測裡配分最大的一項,所以它也是最昂貴的那個什麼都沒告訴你的項目。 兩者底下是同一個毛病。幾乎每一分都給了每個網站本來就具備的東西,或是給了其他語言的頁面根本寫不出來的英文用詞,而這樣的分數無論量得多仔細,都分不出兩個網站的差別。
分數有變動嗎?有,而且兩個方向都有,這個日期之前與之後的分數不能互相比較。中文、日文、韓文頁面現在會被獨特性那一項評分,而先前它是被完全排除在這些頁面的分數之外的。所有網站都會在爬蟲那一項上被重新評分:願意讓 AI 引擎進來、並且用可跟隨的連結往站內其他頁面延伸的網站,分數會比先前高;封鎖引擎、把頁面標成 noindex、或是不給爬蟲任何往下走的路徑的網站,分數會明顯下降。在同一批 200 個頁面上量測,拿到最常見那一個爬蟲分數的比例從 55% 降到 10%,不同分數的數量則從 27 個增加到 59 個;獨特性那一項拿到 0 分的比例從 63% 降到 34%,而做得好的頁面在這一項能拿到的最高分則從 69 升到 90 分,後者本身就是個缺陷:先前這世上沒有任何網站能在這一項上被評為良好。
評分準則版本 2026-08-09
改了什麼。我們對評分引擎做了一次全面稽核,找出 28 項缺陷,修正之後,十九個評分項目裡有十二個所衡量的東西改變了。其中兩項不是調整,而是修好了從來就沒運作過的東西。第一,讀取網頁文字的方式會連同網頁本身的程式碼與樣式設定一起算進去,當成文章內容,而且在引擎裡有十三個地方都是這樣。第二,網站用來告訴自動程式哪些內容可以讀取的那個檔案,被丟進了為網頁設計的轉換器,結果每一行都被串成一行,於是一個封鎖 AI 搜尋引擎的網站,看起來就跟完全開放的網站一模一樣。除此之外,網站可存取性的配分方式、非英文頁面的評判方式、什麼算引用、什麼算內容夠新、什麼算一個有獨特價值的頁面,也都改變了。這十二項裡改動最大的是頁面效能。它原本只看頁面抓不抓得到、回應快不快,而幾乎每個頁面都會通過,所以我們量測過的繁體中文網站全部拿到同一個分數,日文網站也是。現在它衡量的是機器要讀懂這個頁面實際得做多少事:有多少腳本與樣式表必須先載入頁面才會出現,以及每一個字的內容用掉多少標記。
為什麼改。這些項目衡量的,都不是它們宣稱要衡量的東西。程式碼那一項最明顯:一個只有三百字內容、但帶著龐大程式套件的頁面,會被算成好幾萬字,然後我們還會建議它再多寫好幾萬字。存取檔案那一項影響最大:在 47 個真實網站的樣本中,有 36% 正在封鎖某個 AI 搜尋引擎,而我們完全看不到,因此把它們當成歡迎所有引擎來評分。
分數有變動嗎?有,而且幅度不小,兩個方向都有。這個日期前後的分數「不能」互相比較,也不應該被解讀成網站表現的變化。程式碼較多的網站分數通常會下降,因為那些程式碼不再被算成內容。封鎖 AI 搜尋引擎的網站在存取性上會下降,因為那個封鎖現在看得見了。也有一些網站分數會上升,因為原本有項目在對它們做出過嚴的判定。單就頁面效能這一項來說,過去幾乎每個網站都拿滿分,現在多數會低於滿分;在 200 個真實頁面上量測,對總分的平均影響不到 1 分,而且繁體中文、日文、韓文與英文的幅度都一樣。我們公開的「分數能否預測實際被引用」那個數字,是在前一代引擎上測得的,並不描述這一代;我們正在重新測量,無論結果往哪個方向走都會公布。
版本 2026-08-04 內的一次修正,2026-08-08
改了什麼。分數對應的等第調整了。A+ 的門檻從 90 降到 75,A 從 80 降到 68,B 從 70 降到 62,C 從 60 降到 55,D 從 50 降到 45。分數本身沒有變,十九個評分項目和它們的權重也都沒有變。
為什麼改。原本的門檻沿用學校的評分方式,從來沒有對照過真實網頁實際考幾分。在本站已公開的 764 份檢測中,這套門檻把 47% 的網站評為 F,而且從來沒有給過任何一個 A。我們用同一套評分去跑 Stripe、Cloudflare、Anthropic、OpenAI、Vercel、Notion 等十四個網站的首頁,結果每一個都落在 62 分附近,因為要拿到滿分 100,等於要求同一個頁面同時是首頁、問答頁、有引用來源的研究文章,還要有作者署名。一套會把 Stripe 評為 C 的標準,描述的是自己的刻度,而不是真實的網路。新的門檻是依照實際測得的分布訂出來的,A+ 約為前 0.2%,A 約為前 3%。
分數有變動嗎?沒有。每一個分數都和先前完全一樣,這次調整前後的兩份檢測可以直接比較。改變的只有分數旁邊的那個字母,而且只可能往上,因為所有門檻都調低了。我們公開的「分數能否預測實際被引用」驗證結果不受影響,因為那衡量的是分數之間的排序,而等第門檻並不屬於排序的一部分。這個基準是固定的,不會隨著更多網站接受檢測而重新計算,所以你的等第不會因為別人做了檢測而改變。
版本 2026-08-04 內的一次修正,2026-08-05
改了什麼。如果一個頁面沒有標示 canonical 網址,它所有對外的連結都會被誤判成連回自己,所以不管它引用了多少外部來源,這一項都拿不到分數。
為什麼改。判斷連結是不是連回自己的規則,是拿每個連結去比對該頁的 canonical 網址。當頁面根本沒有標示 canonical 時,比對的對象就變成一段空字串,而任何網址都包含空字串,於是每一個連結都被判定成連回自己。
分數有變動嗎?有,但只影響一種頁面:沒有標示 canonical 網址、而且確實有對外連結的頁面。這類頁面當時在總分 100 分裡,最多多拿了 3.15 分不該拿的分數。有標示 canonical 的頁面完全不受影響,沒有對外連結的頁面也一樣。這次版本編號沒有跟著變動,因為改的不是評分準則本身,而是準則被套用時的一個錯誤;也就是說,檢測結果本身不會記錄它是在修正前還是修正後產生的。如果你要比較八月初前後、同一個沒有 canonical 標籤的頁面的兩次檢測,請把這一點考慮進去。
評分準則版本 2026-08-04
改了什麼。非英文的頁面,不再用為英文設計的機制來衡量。這一版一次改了三件事。過去計算字數的方式是用空格切開文字,但中文和日文並不用空格分隔,所以一整頁的中文內容可能被算成幾乎沒有字,接著被當成空殼頁面丟掉。另外有四個因子,因為檢查方式是找英文字詞,就整個在中文和日文頁面上被關掉,但它們檢查的內容其實有很大一部分是與語言無關的標記。還有可讀性這個因子,一直是把整頁連同導覽列和頁尾一起讀進來算,而不是只讀主要內容。
為什麼改。這三件事都是衡量上的錯誤,不是我們改變了看法。一個中文頁面不是被打了低分,而是根本沒有被評分,頁面上也沒有任何地方看得出來。把那四個因子整個關掉,同時錯在兩個方向:標記少的中文和日文頁面被高估,標記做得完整的則被低估。三件事放在同一版一起推出,是因為任何一件單獨改,都會需要把所有分數重跑一次。
分數有變動嗎?有,而且是這份清單裡變動最大的一次。中文和日文頁面會依標記多寡變動 9 到 16 分。英文頁面也會有小幅變動,因為可讀性的修正同樣會影響它們,這也是為什麼這次重跑涵蓋全部,而不只是中文和日文的部分。除此之外,英文的評分邏輯沒有變,我們逐一因子確認過。這一版和前一版的分數並不是在量同一件事,所以在任何分數重新進入產業基準之前,我們把已發布的分數全部用這一版重跑了一遍。
評分準則版本 2026-08-02
改了什麼。市場調整開始生效。Kuroma 會依照品牌所在的市場調整分數,例如台灣的網站以繁體中文撰寫會拿到加分。但這項調整在此之前,從來沒有真正套用在任何人身上。
為什麼改。調整對照表是用市場代碼查詢的,而系統裡每一處查詢時傳進去的都是市場的資料庫識別碼。查詢一直落空又不會報錯,所以每個市場的評分結果完全相同,這項功能在它的整個生命週期裡都只存在於紙上。前一個月的一次檢查確認了對照表裡確實有正確的 20 個市場,卻沒有人問過到底有沒有任何程式讀取它。
分數有變動嗎?有,影響的是那 20 個已設定調整規則的市場裡的品牌。一個品牌最多會往上變動 8 分;如果網站語言與所在市場不符,則會往下 1 分。台灣品牌通常變動約 5 分。變動幅度不是等比例的,因為已經滿分的類別沒有地方再加分。沒有指定市場的檢測結果,在這次改動前後完全一致,而公開基準語料庫大部分屬於這一類。
評分準則版本 2026-08-01
改了什麼。結構化資料品質這個因子,開始衡量本頁一直以來告訴訪客它在衡量的東西:HTML 本身裡面的資料結構,也就是有標題列的表格、三項以上的清單,以及定義清單。在這一版之前,它實際上評的是 schema.org 標記。
為什麼改。這個因子在七月依證據重新界定了範圍,本頁也同步更新了,但評分程式沒有跟著改。有大約三週半的時間,公開的評分準則描述的是一件事,引擎衡量的是另一件事。這裡值得把話說清楚:本頁是由評分引擎讀取權重的同一份定義所產生的,所以這裡看到的權重一定就是引擎用的權重,但這項保證從來就不涵蓋單一因子的程式實際上去看了什麼。這一次落在的正是它沒有涵蓋的那個缺口,也是我們把它公開出來的理由。我們選擇改評分程式來對齊公開的準則,而不是反過來改文字:改文字等於悄悄推翻一個有證據支持的決定,而且 schema.org 在評分準則的其他地方,已經以它應得的近乎為零的權重被評分過了。
分數有變動嗎?有,而且對某一種頁面影響很劇烈。一個 schema.org 標記豐富、但沒有表格也沒有清單的頁面,在這個因子上會從接近滿分掉到接近零分。這個因子佔總分 100 分裡的 4.5 分。這一版前後的分數不能混在一起看:那等於拿以 schema.org 評分的網站,去跟以表格評分的網站相比。
評分準則版本 2026-07-08
改了什麼。有三個因子在此之前只認得英文,這一版為它們加上了中文的語言樣式:外部引用與參考來源、內容新鮮度,以及答案框潛力。
為什麼改。這三個因子找的是英文字詞與片語,所以中文頁面不論寫得多好,在這些地方都拿不到分數。
分數有變動嗎?只影響中文頁面。英文的評分結果完全相同,這也是為什麼在這份清單裡,只有這一版的分數仍然可以和前一版相比。
評分準則版本 2026-07-07
改了什麼。整份評分準則依證據重新調整了權重,本頁也在這時候首次公開。有六項權重變動,列在下方。同時新增了原始 HTML 可用性這個因子,因子總數從 18 增加到 19,理由是沒有任何主要的 AI 爬蟲會執行 JavaScript,只有在腳本跑完之後才出現的內容,對它們來說是看不見的。頁面效能也從分級評分改成通過或不通過,只看頁面到底抓不抓得到。
為什麼改。原本的權重是從傳統搜尋的做法沿用下來的,而在有對照研究的地方,研究結果和那些權重並不一致。加上 schema.org 標記並沒有提升 AI 引用,所以它的權重降到幾乎為零。封鎖 AI 爬蟲則可驗證地會讓網站從該引擎的答案裡消失,所以可爬取性成為技術類別中最重要的因子。作者簡介從來沒有被當成 AI 引用的成因檢驗過,因此調降回基本功的權重。這一版也是評分準則變成單一份共用定義的起點:評分引擎和本頁讀的是同一份定義,這正是上面每一項你都能自己去查證的原因。
分數有變動嗎?有,而且影響每一個人。大部分因子的權重都動了,還新增了一個因子,所以這個時間點之前的分數,都無法和之後的分數相比。
| 因子 | 原本權重 | 調整後權重 |
|---|---|---|
| 可爬取性與可存取性 | 20% | 65% |
| Schema 標記完整性 | 35% | 5% |
| 頁面效能指標 | 25% | 10% |
| E-E-A-T 訊號 | 40% | 28% |
| 獨特價值主張 | 35% | 17% |
| 媒體無障礙性 | 15% | 7% |
評分準則版本 2026-06-28
改了什麼。媒體無障礙性以第 18 個因子的身分加入頁面內容類別,起始權重是該類別的 15%,同時類別裡原有的五個因子重新調整權重,讓整個類別仍然加總為 100%。九天後在上面那次權重調整裡,它被降到 7%。
為什麼改。鎖在圖片或影片裡的文字,AI 引擎是看不到的,而當時的評分準則裡,沒有任何地方在問有沒有提供文字替代方案。起始權重是依研究而不是依我們自己的資料設定的,當時也註明了它是暫定值。
分數有變動嗎?有。新的因子進入一個類別,鄰近因子的權重也跟著挪動,所以前後的分數不能相比。
我們怎麼知道的。本條目是依據當時的變更紀錄與我們的內部規格文件重建的。這一版早於本頁所依據的那份共用評分準則定義,所以當時並沒有公開的評分準則可以對照。
評分準則版本 2026-06-06
改了什麼。第一個版本編號,是在修正三個評分缺陷的那天加上去的。llms.txt 原本值 30 分,降到 5 分。網站在 robots.txt 裡封鎖爬蟲這件事,原本會在兩個不同的因子裡各扣一次分。而完全沒有 robots.txt 檔案的網站,原本反而會因為它不存在而白拿 15 分。
為什麼改。這三項修正都會讓分數變動,而當時儲存下來的檢測結果,沒有任何地方記載它是由哪一版準則產生的。加上版本編號,是為了讓日後分數下降時,能夠歸因於準則改版,而不是誤以為網站變差了。
分數有變動嗎?有。這個時間點之前的檢測結果完全沒有版本編號,所以無從得知它們是由哪一版準則產生的;檢測的日期並不能證明版本。它們無法和這份清單裡的任何一版相比。
我們怎麼知道的。本條目是依據加上版本編號的那次變更與我們的內部規格文件重建的。實際做出那三項修正的變更本身沒有留下任何說明,而且這一版早於本頁所依據的那份共用評分準則定義。
現在就拿自己的網站測一次。免費 AI 就緒度檢測會依照這份評分準則替任何網址評分,大約一分鐘。接著,再拿 AI 一直提到的那個競爭對手測一次。