跳轉到主要內容
AEO/GEO

如何在不欺騙自己的情況下衡量AI可見性?

簡短回答。連續兩天向答案引擎提出相同問題,其大部分來源都會發生變化。在Parse對693,509個答案的研究中,ChatGPT僅重複了21.2%的引用……

Lifewood Data Technology · 2026年8月14日 · 閱讀約 8 分鐘

簡短回答。 如果連續兩天向答案引擎提出相同的問題,其引用的來源大多會發生變化。在對693,509個回答的Parse研究中,ChatGPT在重複提問時僅重複了21.2%的引用領域,而Google AI Overviews則為31.5%。能夠經受住這種變化的度量標準,是基於多次運行估算出的速率,按引擎和市場分別報告,且檢索與記憶模式分開——絕不會出現一個位置,絕不會出現單一融合得分,也絕不會出現截圖。

目前市場上大多數所謂的AI可見性報告,實際上只是以基準為名的演示。截圖、單次審計、周環比變化圖:每一種都把噪聲誤認為信號,因為系統的噪聲遠超報告所假設的程度。

本文旨在闡明噪聲基線,明確其排除範圍,說明何為可辯護的測量方法,界定足夠的運行次數,以及如何區分真正的測量與演示。


系統到底有多嘈雜?

兩項2026年的研究——不同團隊、不同方法、不同月份——結果高度一致。

測量 研究發現
在第二次提問中重複引用的領域 ChatGPT 21.2%, Google AI Overviews 31.5% Parse,共分析了16,143個ChatGPT和15,805個Google提示的693,509個回答,時間範圍為2026年3月26日至4月25日
相同結果,擴展至一週窗口 ChatGPT 26.7%, Google AI Overviews 36.8% 解析,如上所述
每日來源變化率 Gemini 88.3%, ChatGPT 79.2%, Google AI Mode 75.9%, Perplexity 44.4% GetMentions,共181,225個URL和2,398個查詢,在連續七天內,2026年6月,引用總數達530,875次
所有七天內均被引用的來源 Perplexity 11.1%, Google AI Mode 2.6%, ChatGPT 1.1%, Gemini 0.4% GetMentions,如上所述
僅被四個引擎中的一個引用的來源 84% GetMentions,如上所述

三個數字承載了論點:大約 79% 的 ChatGPT 來源在一夜之間就發生了變化,大約 1% 的來源能存活一週,而 84% 的問題來源僅出現在一個引擎上

一個 AI 答案的截圖並不是證據。它只是來自一個尾部非常厚重的分佈中的一個抽樣結果。


這排除了什麼?

  • 一次性的審計。 "我們問了 ChatGPT 十個問題,你們出現了兩次。" 在這種更替率下,這幾乎與任何底層可見性率都是兼容的。

  • 位置語言。 "你們在這個提示中排名第三。" 由於大約 1% 的七日來源持久性,位置並不是系統所具備的屬性。

  • 來自小提示集的周環比變動圖表。 每週都會出現變動,無論是否有實際變化,而一個始終變動的圖表無法檢測到變化。

  • 單一融合的 AI 可見性分數。 由於 84% 的來源僅屬於一個引擎,平均值刪除了數據中唯一可操作的結構。

  • 將一週內的變化歸因於單一行動。 因果性聲明需要對照組,而大多數項目都沒有對照組。


什麼是答案份額?

答案份額是指品牌在一組AI生成的答案中出現的頻率,相對於總機會或競爭對手而言。目前行業內尚無標準化公式,因此記錄自己版本的公式是關鍵步驟。

答案份額 = 提及品牌的答案數 ÷ 固定問題集的答案總數
引用份額 = 鏈接或明確歸屬於品牌的答案數 ÷ 提及品牌的答案數

最簡單的版本是跟蹤提示中提及品牌的比例;加權版本則會考慮提及的顯著性、在答案中的位置或是否提供了鏈接。一致性比選擇完美的公式更重要:確保提示集、引擎、地理區域、語言和評分規則穩定,使得兩個時間段的對比是可比的。

僅提及率是不夠的。應同時跟蹤自有域名引用率、第三方引用率、競爭對手提及情況、實際被引用的頁面數量,以及描述是否準確、不完整或錯誤的定性字段。一個提及率儀表盤會將一個自信錯誤的答案視為成功。


一個有辯護力的測量標準應該是什麼樣子?

解決方法不是使用更好的工具。而是將這個問題視為抽樣,而抽樣是一個已解決的問題。

  1. 在開始之前就固定問題集,並凍結問題的表述。 重新表述的問題屬於一個新的系列,而不是延續。如果文本可以在後期編輯,那麼每一條趨勢線都是不可驗證的。
  2. 將問題寫成買家實際會問的話。 "誰可以實現對日韓市場的AI可見性?" 是一個問題。"multilingual AEO services" 是一個關鍵詞,但沒有人會把這個詞輸入到助手裡。
  3. 將檢索與記憶分開,並且絕不將二者平均。 當開啟檢索時,引擎會引用URL,並對您發佈的最新內容在幾天到幾週內做出響應。當檢索關閉時,它會從訓練數據中作答,只有在新模型發佈時才會改變。將二者混合會導致四分之一正確檢索看起來像是失敗。
  4. 重複運行並報告一個比率。 單位是“在四周內40個問題的34%運行中被命名”,而不是“排名第三”。在噪聲下比率是可以估算的;而排名則不行。
  5. 分別測量每個引擎和每個市場。 引擎按市場劃分是一個矩陣,單個數字並不能概括這個矩陣。
  6. 包含你並不打算獲勝的控制問題 —— 一個你並不服務的相鄰類別。如果你開始出現在那裡,那就是定位錯誤,而不是進步,這也是判斷模型底層真實變化與基準變化之間真實移動的最便宜方式。
  7. 將提及與鏈接分開記錄。 即使沒有鏈接,準確的描述仍然會影響買家的看法,而在記憶模式的回答中,這是唯一可獲得的結果。
  8. 故意改寫。 重複估計穩定性;改寫後的內容展示在語言表達變化時可見性是否得以保留。
  9. 記錄原始回答。 當一個數字發生變化時,唯一能解釋其變化的方式是閱讀具體發生了什麼變化。

多少次運行才算夠?

沒有通用的數字,但答案的形狀是明確的。你是在高方差下估計一個比例,因此精度隨著觀測數量的平方根而提升——而一個觀測就是一個問題、一次運行、一個引擎。

設計 每臺引擎的觀測數量 它支持的功能
10個問題每週檢查一次 10 一個演示。不足以區分20%和40%的可見度在觀察到的流失率上
40個問題,每週兩次,持續四周 320 足以觀察到真正的顯著變化,並忽略普通的周與周之間的噪聲

不同引擎的採樣成本並不相等:在每日流失率為44.4%的情況下,相較於Gemini的88.3%(GetMentions, 2026年6月),在Perplexity上進行相同置信度的採樣成本要低得多

一份誠實的初步報告指出:"在對四個引擎的40個買家問題進行八次測試中,我們在ChatGPT的運行中被提及了6%,在Gemini的運行中為0%,在Perplexity的運行中為11%,在Google AI Mode的運行中為2%。在Gemini上的信心最低,因為其流失率最高。" 這是可操作的。"你在AI搜索中是不可見的" 並不是。


在你們的類別中,一個好的數值應該是什麼樣子?

沒有了解誰擁有該類別,絕對數值本身意義不大。Semrush與Growth Memo的Kevin Indig合作,在2026年1月至6月期間,對ChatGPT中的1,094個美國類別進行了跟蹤:15.2%類別有明確的所有者,31.2%類別處於新興領導者階段,53.7%類別處於混亂狀態,而在月度對比中,明確所有者佔據領先位置的比例達到90.4%。因此,在一個混亂的類別——大多數類別都是如此——中,一個適度且持續的份額即代表領先地位,基準應是表現最佳的競爭對手,而非一個絕對目標。當一個類別有明確所有者時,其被取代的速度很慢,更現實的目標是實現第二來源的覆蓋。


如何辨別真正的測量數據與演示數據?

你聲稱將聽到的內容 它失敗的原因 你應該問的問題
"你在該提示下的排名是第3位" 答案沒有穩定的位置;大約1%的來源能持續一週 重複運行中的比率是多少?
您的AI可見性得分為42 融合了大多不共享來源的引擎 請展示每個引擎、每個市場的得分
本週我們觀察到提升了12% 處於小提示集的噪聲基線之內 有多少個觀測值,置信度是多少?
我們可以保證引用 沒有引擎提供提交或位置安排 你合同上承諾的是什麼結果?
你在0%的AI答案中出現 通常是一次運行,通常為內存模式 哪種模式,多少次運行,哪些問題?
我們進行了優化,引用數量上升了 沒有控制問題,沒有反事實 在那個時期,控制集做了什麼?

每週或每月的報告應該展示什麼內容?

整體答案份額及其與前一時期的變化;最強和最弱的主題集群;新增和丟失的引用;競爭對手的增益;任何錯誤描述品牌的內容;以及接下來計劃採取的行動。包含提示級別的原始證據,以便利益相關方可以審計摘要,而不是單純信任它。

在可能的情況下,將由您工作引起的變動與平臺波動分開——當平臺進行重大更新時,其對眾多品牌的可見性都會產生影響,否則這種變化會被誤認為是結果。將可見性框架為一箇中間指標:在數據分析允許的情況下,追蹤提及AI推薦的流量來源、潛在客戶來源以及銷售對話,但不主張從提及率到收入之間存在因果關係,因為數據並不支持這一點。

測量存在硬性限制。它無法使系統變得確定——您可以精確估算一個速率,但無法重現某個具體答案。它無法在報告週期內解決記憶模式缺失的問題。對收入的歸因仍然困難,因為AI推薦通常無法明確歸因。基準指標會迅速過時,因此上述每一個數據點都附有日期。


Lifewood的應對方式

Lifewood 將 AI 可見性作為一項可測量的項目而非一些建議,分別在客戶站點和自身運營中實施。該工具為內部開發:使用固定提示集和固定措辭,設有前期基準,分別報告檢索和記憶情況,每個集都包含控制問題,並保留原始運行文件,以便當某個數值發生變化時可以解釋而非猜測。對於多市場項目,限制因素是作者身份而非工具本身:50多種語言覆蓋30多個國家的40多個交付中心 意味著提示集是按市場本地化編寫而非翻譯,因為越南買家提出的問題通常不是將英文問題簡單翻譯成越南語的問題。

參見 AEO服務GEO服務如何獲得AI答案引擎的引用GEO與AEO與傳統SEO的區別


資料與進一步閱讀

  • 解析 按行業劃分的AI引用波動 —— 693,509條答案,2026年3月26日至4月25日。
  • 獲取提及信息,AI引用波動性 — 530,875次引用,2,398個查詢,2026年6月。
  • 與Kevin Indig合作使用Semrush,增長備忘錄,AI可見性是主題級別的遊戲,2026年1月至6月。

常見問題

固定一組買家問題,保持措辭不變,反覆將其提交給各個引擎,在檢索和記憶模式下運行,並報告品牌被提及或引用的運行次數佔比。輸出結果是每個引擎和每個市場的比率及其置信區間,而不是排名,也不是單一的綜合分數。

不。沒有通用的行業公式,因此評分方法必須被記錄並保持一致。一個簡單的版本是被追蹤提示中提及品牌的比例;加權版本則會增加重要性、回答中的位置或是否提供鏈接等因素。

因為它們從ChatGPT系統中以不同時間採樣不同的問題,而該系統每天大約有79%的源內容更替,其中84%的問題來源僅出現在一個引擎上(GetMentions,2026年6月)。兩個誠實的工具使用不同的提示集,會產生不同的數值,這是完全可以理解的。

足夠多,以使更替現象平均化。十個提示每次檢查一次可以作為演示。大約40個買家問題每週運行兩次,持續一個月,每個引擎可獲得數百個觀察值——足以將真正的顯著變化與普通噪聲區分開來。

必須。檢索模式會響應您在幾天到幾週內發佈的內容,並能引用URL。記憶模式則基於訓練數據進行回答,只有在新模型發佈時才會發生變化。將兩者平均會使得數月的正確檢索工作看起來像是失敗。

控制性問題是指你在相鄰類別中故意不打算贏得的查詢。如果你開始在這些問題上出現,這表明定位錯誤而非進展。它們也是區分真實運動與模型在基準下發生變化的最廉價方式。

在檢索層面上,已發佈的變更可以在幾天到幾週內顯現,但要證明這種變化,需要在數週內進行多次運行。在記憶層面上,你發佈的任何內容都不會改變數值,直到訓練出一個新模型為止。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊