跳轉到主要內容
AEO/GEO

AI爬蟲:哪些機器人允許,哪些阻斷,以及原因

簡短回答。訓練爬蟲和檢索爬蟲是不同機器人執行不同任務,大多數阻斷決策將它們視為一個整體。阻斷訓練爬蟲將對你造成損失……

Lifewood Data Technology · 2026年8月15日 · 閱讀約 8 分鐘

簡短回答。 訓練爬蟲和檢索爬蟲是 執行不同任務的不同機器人,而大多數阻斷決策將它們視為一個整體。阻斷訓練爬蟲不會造成你目前可以衡量的任何損失。阻斷 檢索 爬蟲將導致引用無法實現。陷阱在於,通用默認設置並未區分它們:根據Digital Applied引用的Cloudflare官方文檔,自2025年7月1日起,新域名在Cloudflare上默認通過一個標記為‘訓練’的開關阻斷 GPTBot, ClaudeBot 和 PerplexityBot

在任何內容被委託用於AI可見性之前,一個關鍵問題決定了資金是否可支出:引擎的爬蟲能否獲取網頁?在大量網站上,它們無法做到,而營銷團隊中沒有人做出過這一判斷。本文詳細說明了每個機器人實際做什麼、哪些被阻斷、爬蟲到推薦的經濟實際狀況,以及一個在審查後仍能持續存在的默認政策。


每個機器人實際做什麼

用戶代理字符串是整個決策的依據。這些在 robots.txt 中是獨立的指令,可以分別設置。

用戶代理 操作員 任務 阻止它會帶來成本
OAI-SearchBot OpenAI 從該構建索引以獲取 ChatGPT 搜索答案 是否存在 ChatGPT 的引用
GPTBot OpenAI 收集訓練數據 在未來的模型內存中的存在
ChatGPT-User OpenAI 在用戶請求期間實時獲取頁面 當用戶詢問時頁面的加載情況
ClaudeBot Anthropic 收集訓練數據 在未來的模型內存中的存在
Claude-SearchBot / Claude-User Anthropic 檢索和實時用戶獲取 在 Claude 回答中的引用
PerplexityBot Perplexity 構建其檢索索引 在 Perplexity 回答中的引用
Google-Extended Google 僅用於控制 Gemini 的訓練使用 搜索或AI概覽中沒有任何內容
Googlebot Google 搜索索引,以及AI概覽的基礎 搜索與AI概覽的結合

Google-Extended在昂貴方向上是人們理解錯誤的。它管理的是訓練使用,而不是搜索。阻斷它並不會讓你脫離AI概覽,因為AI概覽是基於普通Googlebot爬取的內容構建的——而AI模式也是如此。不存在一個單獨的退出選項來保留搜索功能,同時進入AI概覽。

OpenAI的劃分在相反方向上也具有同樣的意義:ChatGPT引用的是OAI-SearchBot的索引,而不是來自GPTBot的訓練爬取,因此一個站點如果阻斷了‘OpenAI’這一項,就會同時失去可引用的部分和可訓練的部分。


默認設置會阻斷你,而沒有任何人主動決定

自2025年7月1日起,Cloudflare對新域名的默認設置會阻斷GPTBot、ClaudeBot和PerplexityBot,且該設置無法區分訓練爬蟲與檢索爬蟲。PerplexityBot完全是檢索爬蟲,它被一個標記為訓練用途的控制項所捕獲。

這是導致站點在AI回答中不可見的最常見原因,而這種不可見性並非任何人主動選擇的結果。一個站點即使寫得完美、結構完整、完全使用了Schema標記,也可能因為基礎設施默認設置在域名上線當天被設定,而變得完全無法被引用。

四個檢查步驟,按其失敗順序進行:

  • 獲取/robots.txt並閱讀它。 查看每個AI用戶代理的名稱下是否有Disallow,而不僅僅是*下的內容。
  • 單獨檢查CDN或WAF層。 即使robots.txt設置寬鬆,如果邊緣節點返回403給爬蟲,也毫無意義。
  • 檢查服務器日誌或CDN分析中的實際訪問記錄,確認來自OAI-SearchBot、PerplexityBot和Googlebot的真實訪問。權限是一種聲明,而日誌中的200狀態碼才是證據。
  • 檢查是否存在JavaScript依賴的內容。 檢索爬蟲無法保證執行這些內容,如果頁面內容只有在加載後才出現,那麼對它們來說可能只是一個空頁面。

哪些內容被阻斷,以及阻斷程度

阻斷現在已足夠普遍,成為市場塑造的事實,而非邊緣案例。Technology Checker在2026年7月發佈的報告解析了2026年7月27日採集的4,223個robots.txt文件:

用戶代理 禁止阻斷的域名
GPTBot 633
CCBot 567
ClaudeBot 563
Google-Extended 522
Bytespider 518

該報告按聲明用途將AI爬蟲流量進行了細分:44.54%為訓練用途,39.99%為混合用途,11.57%為搜索用途,2.66%為用戶發起用途。訓練和混合用途爬取合計佔AI爬蟲流量的84.5%;搜索和用戶發起的訪問合計佔14.2%。

這一細分是整個論點的核心。絕大多數訪問你的服務器的流量根本無法回溯到你——但那些能夠回溯的少數流量,正是一個全面阻斷所移除的流量。

對於流量規模,Digital Applied報告的2026年5月Cloudflare Radar數據表明,AI爬蟲佔已驗證的機器人流量的20.3%,而AI搜索引擎爬蟲又額外增加了6.5%。GPTBot佔AI爬蟲請求的11.48%,ClaudeBot佔9.73%,與四月的排序相反。


它們索取的與它們返回的之間的關係

阻斷的論據通常基於這個數字,因此需要誠實引用,包括來源之間的分歧。按七月2026年發送的每個引用所爬取的頁面數量:

操作員 技術檢查員 Digital Applied,解讀Cloudflare數據
Anthropic / ClaudeBot 1,917:1 11,122:1
OpenAI / GPTBot 251:1 1,276:1
Perplexity 289:1
Google 4.7:1

兩個來源相差一個數量級,且兩者均被保留在此,而非選擇其一,因為它們測量的是不同的網站面板。兩者均未被引用為the比例。在分歧中倖存的是形狀:AI爬蟲獲取的遠多於它們返回的,而谷歌每爬取一個頁面返回的流量比任何其他爬蟲都高出數量級。

這是一個真正支持阻斷訓練爬蟲的論點,那些擁有真實帶寬成本和內容授權優勢的出版商有理由提出這一點。但這並不是阻斷檢索爬蟲的論點——而這正是常見的默認設置實際上為你做出的決定。


一個可辯護的默認策略

大多數銷售產品而非授權內容的組織,都會大致處於相同的位置。

  1. 允許所有檢索和用戶行為爬蟲。 OAI-SearchBot, Claude-SearchBot, PerplexityBot, ChatGPT-User, Claude-User, Googlebot。這些是唯一能夠產生引用或訪問記錄的爬蟲。除非你故意隱藏內容,否則阻斷它們沒有任何好處。
  2. 原則上決定訓練爬蟲,而非基於流量。 GPTBot, ClaudeBot, CCBot, Google-Extended。允許它們是押注未來模型內存中存在,雖然真實但無法測量且緩慢。阻斷它們目前沒有任何可觀察的成本。兩種選擇都是可辯護的;選擇一種並寫下理由。
  3. 阻斷沒有答案表面的爬蟲。 Bytespider及類似不引用也不轉發的爬蟲。沒有任何內容被放棄。
  4. 在邊緣進行驗證,而不僅僅是基於robots.txt 確認CDN、WAF和爬蟲管理規則與該文件一致。這通常是政策被違背的地方。
  5. 每季度重新檢查。 用戶代理會新增,平臺默認設置會變化,安全審查可能在一個提交中就推翻整個設置。爬蟲訪問是一個需要持續監控的狀態,而不是一個可以完成的任務。

注意第2步中的不對稱性。阻斷訓練爬蟲的成本是不可觀察的;阻斷檢索爬蟲的成本是立即且對那個引擎完全的。當一個決策有一側是可測量的,另一側是不可測量的,應將可測量的一側放在前面。


為什麼llms.txt不屬於這個範疇

它在每一次爬蟲討論中都會被提及,因此值得解決。

谷歌於2026年6月更新的文檔指出,llms.txt不會影響搜索排名或AI概覽,且谷歌搜索關係負責人約翰·穆勒表示,沒有任何AI爬蟲聲稱該文件會提取信息。在採用情況方面,SE Ranking對30萬個域名的研究發現,有10.13%的域名包含llms.txt,而Ahrefs對13.7萬個網站的研究發現,截至2026年5月,有97%已發佈的llms.txt文件流量為零

發佈一個文件是無害的。將其計入AI可見性工作是不恰當的,因為它取代了真正決定你是否能被引用的爬蟲訪問檢查。一個沒有爬蟲讀取的文件,無法替代每一個爬蟲都遵守的Disallow行。


這些內容都無法帶來實際收益

爬蟲訪問是前提,而不是槓桿。可被獲取意味著可以引用;但它並不意味著很可能被引用,也沒有任何人能保證某個AI答案中會出現引用或位置。不同的引擎對它們抓取的頁面所採取的處理方式差異巨大——Perplexity的來源列表遠比ChatGPT的穩定,而谷歌的兩個界面彼此之間也存在矛盾。阻斷決策也無法事後逆轉:當爬蟲被阻斷期間,一個頁面被排除在索引之外,期間並未被引用,而重新抓取的運行是按照操作員的計劃進行,而非你的計劃。


Lifewood的應對方式

Lifewood在任何AEO或GEO項目啟動前,都將爬蟲訪問作為第一道關口,因為如果內容工作針對的是引擎無法抓取的頁面,那麼將沒有任何回報。該檢查是基於證據而非聲明性的:用戶代理讀取的robots.txt,邊緣和WAF規則分別讀取,並檢查服務器日誌中對OAI-SearchBot、PerplexityBot和Googlebot的實際200響應——文件中的許可是一種聲明,而日誌行才是證明。

關於訓練爬蟲的問題被視為客戶政策決策,而非技術默認設置,並附上其理由,以便後續的安全審查不會默默逆轉這一決定。渲染檢查在同一流程中進行,因為一個執行不運行JavaScript的檢索爬蟲,無論robots.txt允許與否,都會讀取一個空頁面。參見AEO服務GEO服務AEO和GEO提供商以及哪些內容會被AI答案引擎引用


資料與進一步閱讀

  • 技術檢查員,robots.txt AI爬蟲阻斷報告,2026年7月27日解析4,223個文件。
  • 數字應用,2026年AI爬蟲與機器人流量統計,基於Cloudflare Radar數據。
  • 數字應用,AI爬蟲訪問控制:2026年決策矩陣
  • Google搜索關係在llms.txt中的內容,2026年6月,通過Baseline Labs提供。
  • SE排名和Ahrefs llms.txt採用研究,由數字應用報告。

常見問題

GPTBot收集用於訓練OpenAI模型的數據。OAI-SearchBot構建ChatGPT在啟用網頁搜索時引用的搜索索引。它們是兩個獨立的用戶代理,各自有獨立的robots.txt指令,只有阻斷OAI-SearchBot才會導致你無法在ChatGPT答案中被引用。

不會。Google-Extended控制你的內容是否被用於Gemini模型訓練。AI概覽是基於普通Googlebot對搜索索引的抓取生成的,因此要退出AI概覽,唯一的辦法是退出搜索。

很有可能。自2025年7月1日起,新加入Cloudflare的域名默認會阻斷GPTBot、ClaudeBot和PerplexityBot,且該控制並未將訓練爬蟲與檢索爬蟲分開。在假設訪問權限之前,請檢查robots.txt、CDN機器人規則以及你的服務器日誌。

如果你反對未付費的訓練使用,應阻斷訓練爬蟲——其可測量的成本接近於零。除非你故意將內容從AI答案中隱藏,否則不應阻斷檢索爬蟲,因為只有它們能夠引用你或發送訪問。

非常少。技術檢查員在2026年7月將各平臺的抓取頁面與引用比例統計為:Anthropic為1,917:1,Perplexity為289:1,OpenAI為251:1,而Google為4.7:1。數字應用基於另一組Cloudflare數據報告了更陡峭的比例,儘管存在較大差異,但方向一致。

目前沒有證據表明它有這種作用。谷歌在 2026 年 6 月更新的文檔指出,llms.txt 對搜索排名或 AI 概覽沒有任何影響,也沒有任何主要的 AI 爬蟲聲稱從該文件中提取內容,Ahrefs 對 137,000 個網站的一項研究發現,2026 年 5 月時,97% 的已發佈文件接收到零流量。

不可靠,並且並非所有爬蟲都會這樣做。當內容僅在客戶端渲染後才存在時,即使爬蟲被完全允許,也可能對檢索爬蟲是不可見的。請確保文本內容在服務器端渲染,或檢查爬蟲實際接收到的內容。

至少每季度檢查一次。新的用戶代理會不斷出現,平臺默認設置可能隨時更改,而且一個無關的網絡安全或機器人管理變更可能在一次提交中就撤銷該策略。應將其視為一個持續監控的狀態,而不是一個已完成的任務。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊