簡短回答。 評估一個ChatGPT可見性合作伙伴,要看他們是否能夠區分ChatGPT回答的兩個層面——模型記憶(訓練權重,隨模型發佈週期變化)和檢索(實時網頁搜索,隨周尺度變化)——併為你展示每個層面的結果。然後檢查三點:一個固定提示集,包含前期基準和多次重複運行,具備內部執行能力而非僅提供推薦文檔,以及對無法控制因素的誠實說明。一個僅提供單一混合‘AI可見性評分’並保證ChatGPT提及數量的合作伙伴,已經失敗了第一個測試。
ChatG及品牌可見性如今已成為採購類別,這意味著它吸引了從嚴謹AEO實踐到帶有加成的儀表盤等各類供應商。這一類別異常難以評估,因為結果具有隨機性,其運作機制部分未公開,且購買組織中幾乎沒有人能獨立驗證任何聲明。
本指南旨在指導評估過程本身:一個合格合作伙伴的方法應是什麼樣子,需要提出哪些證據,如何打分,以及應在合同中寫入哪些內容。如果你想要的是內部操作手冊——即具體的工作內容而非執行主體——請參閱關於提升ChatGPT品牌可見性的配套指南。
你實際上在買什麼?
兩個層面,兩個時間尺度,兩種不同性質的工作。每一次嚴肅的與合作伙伴的對話,都應從這裡開始。
| 模型記憶 | 檢索 | |
|---|---|---|
| 答案所依賴的內容 | 嵌入到模型權重中的訓練數據 | 回答時的實時網頁搜索 |
| 移動所需時間 | 模型生成——數月 | 幾天到幾週 |
| 驅動其變化的因素 | 廣泛語料庫的覆蓋情況:第三方內容、引用、網頁中隨時間的提及 | 可供檢索、包含充分證據的標註頁面,搜索層能夠檢索到 |
| 一個供應商在一季度內可以影響的內容 | 非常少,說實話 | 非常多 |
| 如何進行衡量 | 相同的提示詞,瀏覽離線 | 相同的提示詞,瀏覽在線 |
實際後果:一個合作伙伴報告單一綜合數值時,無法向你展示檢索上的突破,因為記憶慣性會淹沒這一成果。 項目在剛剛開始發揮作用時就被取消,其依據是從未能夠檢測到這一成果的指標。必須在首次會議中要求進行拆分;答案告訴你大部分你需要了解的內容。
在範圍界定方面的一個第二後果:如果你的現實時間跨度是季度,那麼你實際上是在購買檢索工作。記憶表面效應是持續存在和第三方佐證的副產品,任何承諾在季度時間範圍內提供這些效應的合作伙伴,實際上是在描述超出他們控制範圍的內容。
一個合格的方法應該是什麼樣子?
六個組成部分。請合作伙伴在未被提示的情況下描述他們的方法,並檢查其中出現了多少個組成部分。
一個固定的提示集。 通常在每個涵蓋語言中包含20到40個問題:類別問題("誰為企業提供X")、比較問題和品牌問題。該提示集在不同週期間保持固定,否則就無法進行可比性分析。
一項前置基準測試。 在任何執行工作開始前運行。若沒有此項測試,後續改進無法歸因於具體工作——而合作伙伴卻主動刪除了其自身價值的唯一干淨證據,這是一個奇怪的自願選擇。
重複運行和報告的方差。 生成的答案在不同運行間會有所變化。單次提示的運行僅是軼事。請要求提供每個提示的運行次數,以及方差是否與平均值一同報告。
明確的指標定義。 至少包括:
答案份額 = 提及品牌的答案數 ÷ 問題集的答案總數
引用份額 = 鏈接或明確歸屬於品牌的答案數 ÷ 提及品牌的答案數
平均排名 = 答案返回排名列表時,品牌所在位置的平均值
三個不同的問題。一個合作伙伴如果隨意互換使用這些問題,就說明他們並未進行仔細測量。
實體工作應在內容工作之前完成。 如果一個模型無法將您的品牌作為一個單一且可驗證的實體進行解析,內容量的增加也無法解決這個問題。品牌在全資產體系中的命名一致性、已聲明的替代名稱和轉寫形式、可解析的第三方引用,以及非矛盾的結構化數據,必須優先考慮。
是一項執行能力,而非一份建議方案。 請詢問是誰撰寫併發布內容。如果回答是‘由你們團隊根據項目需求說明完成’,則需對即將承接的工作進行定價,並據此評分。
在簽署協議前,您應該要求什麼樣的證據?
六項成果。每一項對於有能力的合作伙伴來說都是低成本產出,且難以偽造。
- 一個來自真實客戶週期的原始運行文件 —— 包含提示詞、時間戳、模型與運行模式、完整回答文本。客戶身份信息可以進行脫敏處理。
- 一個前後對比對。 針對一個提示詞,展示了結果的變化,並附有中間工作期間的日期信息。
- 他們為您的品類所擬定的提示詞集合,在合同簽署前已完成草擬。這能表明他們是否理解您的買家是如何提問的。
- 對您當前資產體系的實體審計 —— 他們從外部能夠觀察到的命名不一致、缺乏佐證和結構矛盾等問題。如果合作伙伴無法提供一頁具體細節,說明他們並未真正進行過審查。
- 他們撰寫的兩份已發表的資產,其中被引用的段落已明確標識。
- 一份說明他們無法控制的內容的書面陳述。 最佳合作伙伴在未被要求的情況下自然產生此類內容。
應該如何對合作夥伴進行評分?
| 標準 | 權重 | 證據 |
|---|---|---|
| 測量方法 | 30% | 基線流程、固定提示集、每個提示的運行次數、記憶/檢索劃分、原始文件 |
| 執行能力 | 25% | 內部撰稿人和審閱人;按語言命名的計數 |
| 實體與技術基礎 | 15% | 您資產的實體審計;爬取與渲染檢查 |
| 答案就緒內容質量 | 15% | 已發佈示例;證據密度;可提取段落 |
| 報告與數據所有權 | 10% | 原始數據導出;合同終止時的內容所有權 |
| 商業條款 | 5% | 通知、漸進上線、峰值容量 |
在任何總得分情況下,若存在以下情況則視為不合格:提及或排名ChatGPT的保證;單一融合可見性得分且無表面拆分;無前期基準數據;拒絕提供原始運行文件;用於非英文市場的提示集被發現為機器翻譯生成。
Weighted score = Σ (criterion score ÷ 5 × weight)
首先執行不合格過濾。若總得分較高但存在不合格條件,則屬於呈現良好的錯誤採購案例。
合同中應包含哪些內容?
五條防止常見爭議的條款。
- 基準作為交付物。 需明確命名、註明日期,並在執行開始前交付,且包含原始文件。
- 報告規範。 明確各項指標、按表面和市場拆分、按何種頻率報告,且支持以非專有格式導出原始數據。
- 內容所有權。 你擁有所有生成內容,包括提示集和測量數據,並在終止時以可使用形式獲得這些內容。
- 模型與方法變更通知。 若合作伙伴更改用於測量的模型或模式,必須提前通知——否則你的趨勢線會無聲斷裂,看起來像是性能變化。
- 無保證條款,明確正面表述。 一段簡短說明,記錄生成答案中內容放置不可控,且參與度以定義明確的領先指標進行衡量。此舉既保護雙方,又悄然排除了不會簽署該條款的合作伙伴。
有哪些警示信號?
承諾內容放置。 沒有人能控制他們不運營的模型輸出。
無公式說明的專有評分。 如果無法從原始數據中復現該數值,那麼它只是營銷手段。
以數量優先的提案。 "每季度發佈六十篇文章" 只涉及表面數量,而非可引用性。已發表的研究結果恰恰相反:在ACM KDD 2024 基準測試中,針對10,000個查詢,權威引述使引用可見度提升最高達40%,統計數據提升約30%,而關鍵詞堆砌則導致下降10%。
語言覆蓋範圍以工具支持計數。 請要求按語言分別列出在市場中的撰稿人和審稿人人數。
未提及實體層。 一個直接跳至內容的合作伙伴,已跳過了最易獲得的勝利路徑。
無混雜因素討論的歸因圖表。 引擎在測量背後不斷變化。一個從未提及這一點的合作伙伴,要麼測量時間不足未察覺,要麼是刻意選擇不說明。
不願說明哪些是無效的。 每一個真實項目都包含無法運作的部分。一個合作伙伴如果無法指出任何無效部分,那麼它提供的不是方法,而是虛假的確定性。
Lifewood的應對方式
Lifewood 在單一 AEO 和 GEO 項目中運行 ChatGPT 可視性,其測量工具由公司內部構建並運營,而非轉售——因此,默認情況下將記憶和檢索分開報告:一個無法區分這兩者的項目,無法分辨緩慢的成功與失敗。
執行工作由公司內部完成,而非回傳給客戶。 50+ 種語言, 40+ 個交付中心,覆蓋 30+ 個國家 和 56,788 名貢獻者,意味著提示集和已發佈的內容均由本地母語人士撰寫,包括在資源匱乏語言中,大多數提供商都會退而採用機器翻譯。Lifewood 的 AI 數據遺產可追溯至 2004 年,當前公司成立於 及 2018 年;服務涵蓋前沿模型實驗室、語音 AI 開發者、AI 計算供應商、計算機視覺供應商以及自動駕駛項目,客戶身份根據協議予以保密。
參見 AEO 服務 和 GEO 服務 瞭解範圍,以及 術語表 以獲取‘答案份額’、‘實體規範化’及相關術語的定義。
資料與進一步閱讀
- Aggarwal 等人,《GEO:生成引擎優化》,ACM SIGKDD 2024 —— 在 10,000 個查詢中:權威引述的引用可見度提升高達 +40%,統計信息提升約 +30%,流暢度提升 +15–30%,關鍵詞堆砌下降 −10%。
- 配套指南:2026 年如何提升 ChatGPT 品牌可見度 —— 本工作的內部操作手冊。
- Lifewood 的交付數據(50+ 種語言,40+ 箇中心,30+ 個國家,56,788 名貢獻者)已發佈於 lifewood.com。