跳轉到主要內容
AEO/GEO

ChatGPT如何決定引用哪些來源

簡短回答。ChatGPT的回答來自兩個不同的地方:搜索開啟時使用實時檢索索引,搜索關閉時則使用訓練過的記憶。只有前者可以引用URL。當它引用時,……

Lifewood Data Technology · 2026年8月13日 · 閱讀約 8 分鐘

簡短回答。 ChatGPT的回答來自兩個不同來源:當搜索開啟時,來自一個實時檢索索引;當搜索關閉時,來自訓練記憶。只有前者可以引用URL。當它引用時,基於1.26億個美國AI搜索提示構建的Semrush AI Visibility Index 2026將它引用的來源數量定為每回答約15個來源,而Gemini約為3個。它重複的來源非常少:在相同問題被問了兩次的情況下,Parse對693,509個回答的研究發現,ChatGPT僅重複了21.2%的引用域名。這裡的可見性是一個比率,而不是一個排名。

每個引擎的每一條引用,都是同一個兩階段過程的終點:文檔必須先被檢索,才能被選定。為可引用性編寫頁面內容改變了第二階段,卻對第一階段毫無作用,因此大量AI可見性工作無法產生可測量的進展——因為它們針對的是頁面從未達到的階段。

ChatGPT對這種區別表現出異常明顯的區分,因為它運行兩種回答模式,且具有完全不同的檢索行為。混淆這兩種模式,是AI可見性報告中最常見的產生荒謬內容的原因。


兩種模式,兩個不同的問題

檢索(retrieval) 關閉檢索(記憶)
會發生什麼 執行檢索、閱讀網頁後作答 從訓練數據中作答
可以引用URL嗎? 不行——它沒有可以指向的文檔
驅動其變化的因素 當前已發佈且可被爬取的內容 訓練截止點之前,整個網絡所表達的內容
響應時間 幾天到幾週 只有當新模型發佈時
誰可以影響它 你,相當直接地 主要是其他人寫關於你的內容

如果一份報告說你的ChatGPT可見性為0%,且未說明其測量的模式,那麼它實際上對你沒有任何信息。在檢索中缺席是一個可解決的發佈和爬取問題,而記憶中的缺席則是一個以模型生成為單位衡量的聲譽問題。


檢索流程,逐個步驟

在開啟搜索的情況下,ChatGPT是一個基於檢索增強的系統,每個階段都是你可能被排除的地方。

  1. 一個爬蟲構建索引。 OpenAI 為不同任務運行獨立的機器人:OAI-SearchBot 構建搜索索引,ChatGPT 從該索引中獲取答案,GPTBot 收集訓練數據,而 ChatGPT-User 在需要時實時獲取網頁內容。阻塞錯誤的機器人會導致錯誤的後果——詳見 AI 爬蟲與 AI 搜索可見性
  2. 問題轉化為搜索查詢。 模型會將用戶的問題重新表述為一個或多個查詢。措辭的微小變化會產生不同的查詢,從而帶來不同的信息來源。
  3. 文檔被檢索並重新排序。 候選文檔返回後,會根據其與重寫查詢的相關性進行打分。這是段落級寫作決策產生效果或失效的關鍵階段。
  4. 答案被組合並附上引用。 模型從其上下文窗口中的文檔中撰寫答案,並標註其使用過的文檔來源。

從該流程的結構可以得出兩點結論。首先,檢索上下文中的位置與內容質量同樣重要——模型看到的是一個子集,而非整個網絡。其次,被使用和被引用是兩個不同的結果。關於引用吸收的研究表明,例如張、何和姚的工作區分了引用選擇與引用吸收,發現檢索到的某個來源可能為答案提供語言、證據或結構,而另一個來源則僅獲得可見的鏈接。因此,引用數量並不能完整衡量影響力,儘管它仍是唯一可以從外部觀察到的指標。


十五個槽位是一種結構優勢

根據 2026 年 1 月至 4 月記錄的 1.26 億條美國 AI 搜索提示,Semrush AI 可見性指數 2026 顯示,ChatGPT 每次回覆平均引用約 15 個來源,而 Gemini 引用約 3 個

這種引用槽位五倍的差異值得在規劃中予以考慮。十五個槽位意味著中等規模品牌可以現實地與現有主導者並列出現在同一答案中。三個槽位則意味著勝利接近於‘贏家通吃’。相同的內容策略在兩個引擎上具有截然不同的勝算,這也是為什麼跨引擎的‘AI 可見性得分’無法成為可操作的指標之一。


五分之四的來源在一夜之間發生改變

這是關於ChatGPT可見性最重要的且最未被報道的事實,兩項獨立研究對此結論高度一致。

Parse在2026年3月26日至4月25日期間,分析了16,143個ChatGPT提示和15,805個Google提示下的693,509個回答,發現重複提問僅返回了21.2%的相同引用域名(ChatGPT),而Google AI Overviews為31.5%。將時間窗口擴大到一週後,兩者重疊率分別僅上升到26.7%和36.8%。

GetMentions,基於2026年6月七天內來自530,875個引用、181,225個不同URL和2,398個真實查詢的數據,從另一個方向測定了同樣的不穩定性:

引擎 每日來源變化率 七天內被引用的來源
Gemini 88.3% 0.4%
ChatGPT 79.2% 1.1%
Google AI模式 75.9% 2.6%
Perplexity 44.4% 11.1%

同一研究發現一個問題的84%來源僅被四個引擎中的一個引用

一張截圖並不是一個測量值。它只是噪聲分佈中的一個樣本。由此產生三個後果,全部屬於商業層面而非技術層面:

  • 單次檢查在任何方向上都無法證明什麼。 未出現一次並不等於不存在;出現一次也不等於可見性。
  • 一週內基於少量提示的變動屬於噪聲。 在每日流失率約為79%的情況下,你需要在固定問題集上進行多次運行,才能確認某種變化具有實際意義。
  • 必須分別對各個引擎進行測量。 由於84%的來源僅屬於某個特定引擎,平均分數掩蓋了你唯一可以採取行動的內容。 尤其是困惑度(Perplexity)的行為方式與ChatGPT完全不同

真正提升概率的因素

鑑於這種波動性,目標不是佔據一個固定位置,而是頻繁進入候選池,從而在可接受的頻率下讓骰子擲出你的結果。

  • 必須能被正確的機器人獲取。 OAI-SearchBot 決定 ChatGPT 是否能引用你,而許多網站在不知情的情況下會阻止這種引用,因為平臺默認設置導致了這一結果。
  • 必須能在段落級別被引用。 自包含的段落,以問題形式呈現的標題,每段一個主張,答案位於第一句話。
  • 攜帶證據,而非形容詞。Carry evidence, not adjectives. Aggarwal, Murahari, Rajpurohit, Kalyan, Narasimhan 和 Deshpande 的 GEO 基準測試(ACM SIGKDD 2024),覆蓋了九個數據集中的約 10,000 個查詢,發現有針對性的內容修改使生成引擎響應中的可見性提升了最高 40%,其中具有權威風格的編輯——添加引用、統計數據和引述——優於諸如重寫、簡化和關鍵詞優化等外觀性編輯。需小心對待該論文的二手版本:流傳的每種策略百分比均未在原文中體現。安全的結論是趨勢方向。
  • 在自身領域之外也要保持存在。在自有網站之外建立品牌存在感。 Omnibound 2026 年 AEO 統計報告指出,大約 85% 的 AI 引用來自第三方網站。《AI 平臺引用來源指數 2026》綜合了六項研究,涵蓋 2024 年 8 月至 等 2026 年 4 月期間記錄的超過 6.8 億條引用,發現 Reddit 是生成引擎中被引用最多的域名,佔比約為總引用頻率的 40%,而 Wikipedia 位居第二,出現在 ChatGPT 頂級 10 個回答中的 26% 至 48% 之間。
  • 保持最新。 檢索在商業類問題上嚴重偏向於最近更新的網頁。

降低可能性的是其鏡像:僅在客戶端渲染後才存在的內容、薄頁或重複頁面、頁面目的不明確、過時的事實,以及難以作為參考支撐的主張。


ChatGPT 在市場中仍佔多少份額

ChatGPT 是大多數 AI 可見性討論中的默認假設,而這一假設正每季度變得越來越不成立。Similarweb 的生成式 AI 交通數據表明,ChatGPT 在該類別中的份額約為 53%,較一年前的約 76% 下降,因為 Gemini 超過了四分之一的流量,而 Claude 增長最快。

2024 年,僅針對 ChatGPT 的項目是可辯護的。到 2026 年,它幾乎遺漏了半數市場,這些引擎引用方式不同、刷新機制不同,並且——根據 GetMentions 的數據——彼此僅共享六分之一的來源。 Google 自己的兩個結果頁面也不一致,且 AI Overviews 是按傳播範圍而非排名進行選擇


這無法做到的事情

  • 沒有提交端點。 你無法請求引用。你只能被爬取、被引用並存在於檢索結果中,而檢索本身已經偏向於這些內容。
  • 記憶模式本季度不可訪問。 如果ChatGPT在搜索關閉的情況下不知道你是誰,那麼發佈更多你自己的頁面也不會改變這一情況,直到下一個模型推出之前。
  • 波動性限制了新聞質量的上限。 在大約1%的七日持續率下,"我們持有查詢X的倉位"這一說法,沒有任何人可以誠實地對ChatGPT做出這樣的斷言。
  • 阻斷決策無法事後逆轉。 一個頁面在機器人被阻斷期間被排除在索引之外,期間未被引用,且重新爬取運行在OpenAI的計劃時間表上。

Lifewood的應對方式

Lifewood 從方法論上將兩種模式分開衡量,因為將它們混合會導致正確的檢索結果看起來像失敗,持續數月。該工具是每個市場固定的一組買家問題,反覆運行而非檢查,以速率形式報告,並保留原始答案——在大約79%的日流失率下,任何低於此水平的數據都屬於帶有小數點的噪音報告。

內容工作首先聚焦於檢索階段:提供不依賴JavaScript的HTML頁面以承載答案、自包含段落,以及段落中的證據密度,而非頁面中的形容詞。在不同市場實現這一點,既是寫作問題,也是交付問題,而這正是50多種語言在30多個國家的40多個交付中心的重要性所在,因為買家用葡萄牙語輸入的問題,並不是其英文翻譯的問題。參見AEO服務GEO服務如何獲得AI答案引擎的引用


資料與進一步閱讀

  • Semrush, 2026年AI可見性指數, 1.26億個美國AI搜索提示,2026年1月至4月。
  • Parse,按行業劃分的AI引用波動性,693,509條答案,2026年3月至4月。
  • GetMentions, AI引用波動性研究:一項包含530,875個引用的數據集,2026年6月。
  • Aggarwal, Murah及Rajpurohit, Kalyan, Narasimhan和Deshpande, GEO:生成式引擎優化, ACM SIGKDD 2024。
  • 張賀和姚, 從引文選擇到引文吸收.
  • 2026年AI平臺引用來源指數,綜合六項研究覆蓋6.8億條引用。
  • Similarweb, 生成式AI流量份額統計數據, 2026.

常見問題

當搜索功能啟用時,它會將問題重寫為搜索查詢,從OpenAI自己的搜索索引中檢索候選文檔,對它們進行重排序,並從選定的段落中組成回答,同時為所使用的段落添加鏈接。選擇發生在段落級別,因此是為回答重寫查詢的特定段落選擇頁面,而不是根據頁面的整體質量進行選擇。

平均約為15,根據Semrush AI Visibility Index在2026年1月至4月期間1.26億個美國搜索提示的測量結果。Gemini引用的數量約為3。這一差異意味著在給定回答中,ChatGPT為非主流品牌出現提供了更大的空間。

因為檢索是概率性的,且索引會動態變化。Parse發現,當相同問題被重複提問時,ChatGPT重複引用的域名僅約為21%,而GetMentions發現,連續七天被引用的來源僅約為1%。任何單一檢查都只是一個噪聲樣本。

OAI-SearchBot構建了ChatGPT引用的搜索索引,因此阻止它將導致無法引用。GPTBot用於收集訓練數據,ChatGPT-User則在實時用戶請求期間獲取網頁內容。它們在robots.txt中是獨立的指令,應分別進行決策。

不能直接且不能快速實現。當搜索關閉時,模型的回答來自訓練數據,因此影響它的內容是第三方在訓練截止前發佈的關於你的信息。這是一個聲譽和獲得覆蓋的問題,只有在新模型訓練時才會得到解決。

不。ChatGPT 的搜索功能運行在 OpenAI 自有的檢索層上,由 OAI-SearchBot 掃描獲取。在 Google 上排名良好,並不意味著你能在 ChatGPT 中被檢索到,因此這兩者需要分別進行衡量。

足夠多,以抵消大約 79% 的每日流失率。實際操作中,這意味著需要反覆運行一組固定的買家問題,報告的是一個比率而非具體位置——而不是每月檢查幾個提示詞。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊