相信各位品牌主都開始遇到這樣的狀況:你的 Google Search Console 後台數字顯示你的網站曝光數一直增加,但是使用者實際的點擊數量卻沒什麼起色。你的潛在客戶直接問 ChatGPT 要推薦名單,AI 卻從頭到尾就是不推薦你。當我們從 SEO 走到 GEO 的時代,業界過去花 (玩) 了 20 年建立起來的成效量測方法,居然漸漸連一個最簡單的問題都無法回答:你的品牌實際曝光的狀況到底是怎樣?
iKala 的 Kuroma 團隊,做的是 AI 能見度 (AI Visibility) 平台。過去一年我們持續量測各家 AI 引擎怎麼談論品牌,也陪著 7 個市場的品牌根據量測結果實際調整。這篇文章整理我們認為真正能衡量 AI 搜尋成效的幾個指標:每個指標能告訴你什麼、不能告訴你什麼,以及我們在幾百個品牌、幾十萬則真實 AI 回答上測量出來的基準值。所有出自我們自己資料的數字,我們都清楚說明來源和日期;目前還沒有人知道答案的問題,我們也明確在文章中點點出。
傳統搜尋結果的排名,不再是好的 AI 搜尋預測指標
舊的規則很單純:排得好,就有點擊,數點擊就好。AI 搜尋把這條規則破壞了兩次。第一次,答案本身就是終點,使用者問完、讀完、離開,誰的網站都沒去。第二次,「排名好」和「被引用為來源」的關聯正在快速鬆脫。針對 Google AI 摘要的大規模爬取分析發現,被引用的頁面同時出現在自然搜尋前段的比例,近幾季一路下滑。排名變成眾多輸入之一,兩者的相關性漸行漸遠。
那要看什麼?六個指標,分成兩類:衡量 AI「認不認識你」的,和衡量 AI「用不用你」的。
指標總覽(實測基準,2026 年 8 月)
| 指標 | 衡量什麼 | 我們的實測基準 |
|---|---|---|
| 提及率 | 相關 AI 回答中點名品牌的比例 | 240+ 個品牌在非品牌探索型問題上的平均為 14.4% |
| AI 聲量佔比 | 品類回答中點名你的份額 | 依品類差異大,務必分引擎量測 |
| 引用率 | 點名你的回答中,同時引用你網站的比例 | 37.2%(換句話說,62.8% 的提及是幽靈提及) |
| 回答率 | 實質回答與迴避的比例 | 探索型問題被迴避的比例不到 2% |
| 準則先行比例 | 完全不點名任何產品的實質回答 | 佔已回答探索型問題的 63 到 67% |
| 檢索對齊度 | 你的內容和引擎實際查詢的語意距離 | 我們量測過提升幅度最大的單一預測特徵 |
基準值全部來自我們自己的量測語料:240+ 個品牌、超過 37,000 則真實引擎回答、重複取樣、七個引擎,收錄到 2026 年 8 月。完整方法(包含每個群組和樣本數)公開在我們的方法論頁面,數字都可以被獨立檢驗。
什麼是 AI 搜尋的提及率(AI mention rate)?
提及率是相關 AI 回答中點名你品牌的比例。拿一組你的買家真的會問的問題,用你的市場和語言去問 AI 搜尋引擎 (ChatGPT, Claude, Gemini, Google AI Overviews 等等),然後數數看你被提到的幾次。它是 AI 搜尋裡最接近「未提示知名度」的東西,也是 AI 搜尋引擎最佳化(GEO,也有人叫 AISEO、AIO 或 AEO)的首要數字。
有兩件事決定一個提及率是能拿來做決策,還是只是好看。第一,問題組不能出現你的品牌名:問「Kuroma 好用嗎」得到的回答裡有 Kuroma,什麼都證明不了。第二,必須重複取樣:AI 回答在不同次執行之間的變動,比多數人想像的大得多。在我們的量測裡,單次檢查的結果跟丟一次硬幣沒兩樣,結果完全是隨機的。所以,任何工具如果只跑一次就給你提及率,你都應該存疑。
什麼是 AI 聲量佔比(AI share of voice)?
聲量佔比是提及率的相對版本:在你品類問題的回答裡,所有被點名的品牌中,你佔了多少?它回答的問題和提及率不同。同樣是 20% 的提及率,在一個 AI 幾乎不點名任何品牌的品類,和一個每則回答都列五個競爭者的品類,意義完全是兩回事。分引擎量測,還能看出你在哪裡強。各引擎引用什麼、點名誰,差異非常大:一份約 6.8 億則 AI 回答引用的分析發現,光是維基百科就佔了 ChatGPT 引用的 7.8%,其他引擎的來源組成則完全不同;我們自己的七引擎語料看到一樣的分歧。一個混在一起的總分,藏起來的比呈現出來的多,而你最弱的那個引擎,通常正好是被儀表板平均掉的那個引擎。
什麼是引用率?什麼是幽靈提及(ghost mention)?
被點名不等於被使用。引用率衡量的是:引擎談到你的時候,有沒有真的把你的網站列為來源。我們在 2026 年 8 月直接測量了這件事:分析 5,714 則點名了受追蹤品牌的 AI 回答,逐一比對這些回答引用的來源,發現品牌自家網站被引用的比例是 37.2%。
關鍵發現:在 62.8% 點名品牌的 AI 回答裡,品牌自己的網站不在來源清單上。引擎是憑記憶在講你,不是看著你的網站講。
反過來解讀,就是所謂的幽靈提及率:明明提到了你、卻不引用你的網站。外部研究也在同樣的規模上記錄了這個現象:大約每三則點名品牌的回答,就有兩則是 AI 憑既有知識在說話,你的網站根本沒有參與那場對話。引擎是在別的地方認識你的。
這組數字是整套指標裡最有用的診斷數字,因為兩個數字對應的是不同的工作。我們的分析還發現一件更尖銳的事:品牌在全網的聲量足跡,能預測 AI 認不認識它,但預測 AI 引不引用它的效果比擲硬幣還差一點。這是我們資料裡最重要的一次脫鉤。真正預測引用的是可檢索性:引擎去查資料的時候,你的內容到底浮不浮得上來。名氣大到天天被幽靈提及的品牌,作為來源可以完全隱形;內容對得準的小品牌,引用表現可以遠超過它的聲量。如果只追蹤一組數字,追蹤這一組。
什麼是回答率(answer rate)?回答的組成為什麼重要?
要有提及,引擎得先給出實質回答。我們把每則受監測的回應分類成已回答、迴避、錯誤三種,而當中組成的變化值得我們仔細檢視。近期的監測資料裡,引擎很少直接拒答,但我們研究發現,買家式探索型問題的實質回答中,大約三分之二完全沒有點名任何產品:在 2026 年 8 月上半月我們分類的 50,018 則已回答檢查裡,這個比例是 63 到 67%。引擎越來越常先講準則,教你該看什麼、怎麼比較,只有一部分回答會走到點名這一步。這不是量測出了問題,是市場在移動:教會買家怎麼挑的那一頁,正在和你的產品頁競爭同一則回答。
檢索對齊度(retrieval alignment):領先指標
上面每個指標都是結果。我們量測過最有潛力的領先指標是檢索對齊度:你網站的內容,和 AI 引擎研究你的品類時實際發出的查詢,在語意上距離多近。引擎不會一字不差地搜尋買家的問題,它們會拆成自己的改寫查詢再去找,而你的網站有沒有東西對得上那些改寫,是可以用向量嵌入量出來的。我們分析 6,950 組品牌與問題的配對、橫跨 193 個品牌,把這一個特徵加進預測模型後,得到我們量測過最大的單次改善。這還早,我們把數字連同它的限制一起發表了,但方向和這篇文章的其他發現一致:對齊引擎怎麼檢索,勝過裝飾人類怎麼閱讀。
什麼「不能」衡量 AI 搜尋成效?
有幾個數字常被當成 AI 搜尋指標,但經不起資料檢驗。自然排名對引用的代表性正在減弱,前面說過了。伺服器日誌裡的 AI 爬蟲流量,量到的多半是訓練用的抓取,不是回答收錄:機器人讀你的網站,不等於機器人引用你的網站。一次性的能見度檢查則是穿著儀表板外衣的雜訊:外部的答案穩定性研究和我們自己的重複取樣都發現,同一個問題在不同次執行引用的來源,重疊程度遠低於儀表板給人的印象。只量一次的東西,量到的主要是運氣。
內容花招也該在這裡記上一筆。替 GEO 命名的那篇2024 年原始論文報告了內容改寫帶來的大幅能見度提升,但近期的重複驗證,以 C-SEO Bench 研究為代表,講了一個冷靜得多的故事:跨引擎、跨領域,多數改寫技巧沒有任何效果,有幾種甚至讓引用排名變差。通過重複驗證的是實質:引用來源、附上證據、放進真實的統計數字。這其實很方便,因為那本來就是好文章的寫法。
怎麼量測 AI 搜尋成效、才不會自欺欺人?
這裡有四個我們透過不斷撞牆學到的實務規則,更新於 2026 年 8 月 15 日:
- 先凍結問題組再開始量測,每次修改都要留版本。
- 重複取樣:只匯報多次執行的比率,不依賴單次檢查。
- 分引擎看:ChatGPT、Gemini、Perplexity 和 Google AI 摘要行為差很多。
- 要求公開量測方法:好的方法必須證明自己真的能預測 AI 引用的能見度。
總結來說:問題組先定好、凍結住,否則你量到的是自己改提示詞的痕跡,不是市場。重複取樣、報比率,永遠不要拿單次結果做決定。每個指標都分引擎看。最後,要求你依賴的任何分數公開它的預測效度:如果有廠商賣你一個 AI 準備度分數,請他拿出這個分數真的能預測引用的證據。我們公開了自己的,連表現差的那個群組也一起放上去。
AI 搜尋是可以量測的,只是我們不能用上一個時代留下來的測量儀器來做。把指標定義清楚、把基準值公開,剩下的讓資料自己去說話。
關於 AI 搜尋指標的常見問題
AI 搜尋成效的核心指標有哪些?
提及率、AI 聲量佔比、引用率、幽靈提及率、回答率、檢索對齊度。前兩個衡量 AI 認不認識你,中間兩個衡量 AI 用不用你當來源。
提及率多少算好?
我們在 240+ 個品牌的非品牌探索型問題上量到的平均是 14.4%,但真正該比的基準是分品類、分引擎,和你的競爭者用同一組凍結的問題比。
為什麼我的品牌被提及卻沒被引用?
因為模型常常憑它已經學到的東西講你。我們量到品牌被點名的回答中,只有 37.2% 引用了自家網站。引用跟著可檢索性走,不跟著名氣走。
SEO 排名對 AI 搜尋還重要嗎?
作為輸入之一,重要;作為計分板,目前的數據是顯示不重要。被引用頁面和自然搜尋前段的重疊已經明顯下滑,我們自己的模型也發現,排名特徵的貢獻遠小於聲量足跡和檢索對齊度。