簡短回答。 訓練爬蟲和檢索爬蟲是 執行不同任務的不同機器人,而大多數阻斷決策將它們視為一個整體。阻斷訓練爬蟲不會造成你目前可以衡量的任何損失。阻斷 檢索 爬蟲將導致引用無法實現。陷阱在於,通用默認設置並未區分它們:根據Digital Applied引用的Cloudflare官方文檔,自2025年7月1日起,新域名在Cloudflare上默認通過一個標記為‘訓練’的開關阻斷 GPTBot, ClaudeBot 和 PerplexityBot。
在任何內容被委託用於AI可見性之前,一個關鍵問題決定了資金是否可支出:引擎的爬蟲能否獲取網頁?在大量網站上,它們無法做到,而營銷團隊中沒有人做出過這一判斷。本文詳細說明了每個機器人實際做什麼、哪些被阻斷、爬蟲到推薦的經濟實際狀況,以及一個在審查後仍能持續存在的默認政策。
每個機器人實際做什麼
用戶代理字符串是整個決策的依據。這些在 robots.txt 中是獨立的指令,可以分別設置。
| 用戶代理 | 操作員 | 任務 | 阻止它會帶來成本 |
|---|---|---|---|
| OAI-SearchBot | OpenAI | 從該構建索引以獲取 ChatGPT 搜索答案 | 是否存在 ChatGPT 的引用 |
| GPTBot | OpenAI | 收集訓練數據 | 在未來的模型內存中的存在 |
| ChatGPT-User | OpenAI | 在用戶請求期間實時獲取頁面 | 當用戶詢問時頁面的加載情況 |
| ClaudeBot | Anthropic | 收集訓練數據 | 在未來的模型內存中的存在 |
| Claude-SearchBot / Claude-User | Anthropic | 檢索和實時用戶獲取 | 在 Claude 回答中的引用 |
| PerplexityBot | Perplexity | 構建其檢索索引 | 在 Perplexity 回答中的引用 |
| Google-Extended | 僅用於控制 Gemini 的訓練使用 | 搜索或AI概覽中沒有任何內容 | |
| Googlebot | 搜索索引,以及AI概覽的基礎 | 搜索與AI概覽的結合 |
Google-Extended在昂貴方向上是人們理解錯誤的。它管理的是訓練使用,而不是搜索。阻斷它並不會讓你脫離AI概覽,因為AI概覽是基於普通Googlebot爬取的內容構建的——而AI模式也是如此。不存在一個單獨的退出選項來保留搜索功能,同時進入AI概覽。
OpenAI的劃分在相反方向上也具有同樣的意義:ChatGPT引用的是OAI-SearchBot的索引,而不是來自GPTBot的訓練爬取,因此一個站點如果阻斷了‘OpenAI’這一項,就會同時失去可引用的部分和可訓練的部分。
默認設置會阻斷你,而沒有任何人主動決定
自2025年7月1日起,Cloudflare對新域名的默認設置會阻斷GPTBot、ClaudeBot和PerplexityBot,且該設置無法區分訓練爬蟲與檢索爬蟲。PerplexityBot完全是檢索爬蟲,它被一個標記為訓練用途的控制項所捕獲。
這是導致站點在AI回答中不可見的最常見原因,而這種不可見性並非任何人主動選擇的結果。一個站點即使寫得完美、結構完整、完全使用了Schema標記,也可能因為基礎設施默認設置在域名上線當天被設定,而變得完全無法被引用。
四個檢查步驟,按其失敗順序進行:
- 獲取
/robots.txt並閱讀它。 查看每個AI用戶代理的名稱下是否有Disallow,而不僅僅是*下的內容。 - 單獨檢查CDN或WAF層。 即使robots.txt設置寬鬆,如果邊緣節點返回403給爬蟲,也毫無意義。
- 檢查服務器日誌或CDN分析中的實際訪問記錄,確認來自OAI-SearchBot、PerplexityBot和Googlebot的真實訪問。權限是一種聲明,而日誌中的200狀態碼才是證據。
- 檢查是否存在JavaScript依賴的內容。 檢索爬蟲無法保證執行這些內容,如果頁面內容只有在加載後才出現,那麼對它們來說可能只是一個空頁面。
哪些內容被阻斷,以及阻斷程度
阻斷現在已足夠普遍,成為市場塑造的事實,而非邊緣案例。Technology Checker在2026年7月發佈的報告解析了2026年7月27日採集的4,223個robots.txt文件:
| 用戶代理 | 禁止阻斷的域名 |
|---|---|
| GPTBot | 633 |
| CCBot | 567 |
| ClaudeBot | 563 |
| Google-Extended | 522 |
| Bytespider | 518 |
該報告按聲明用途將AI爬蟲流量進行了細分:44.54%為訓練用途,39.99%為混合用途,11.57%為搜索用途,2.66%為用戶發起用途。訓練和混合用途爬取合計佔AI爬蟲流量的84.5%;搜索和用戶發起的訪問合計佔14.2%。
這一細分是整個論點的核心。絕大多數訪問你的服務器的流量根本無法回溯到你——但那些能夠回溯的少數流量,正是一個全面阻斷所移除的流量。
對於流量規模,Digital Applied報告的2026年5月Cloudflare Radar數據表明,AI爬蟲佔已驗證的機器人流量的20.3%,而AI搜索引擎爬蟲又額外增加了6.5%。GPTBot佔AI爬蟲請求的11.48%,ClaudeBot佔9.73%,與四月的排序相反。
它們索取的與它們返回的之間的關係
阻斷的論據通常基於這個數字,因此需要誠實引用,包括來源之間的分歧。按七月2026年發送的每個引用所爬取的頁面數量:
| 操作員 | 技術檢查員 | Digital Applied,解讀Cloudflare數據 |
|---|---|---|
| Anthropic / ClaudeBot | 1,917:1 | 11,122:1 |
| OpenAI / GPTBot | 251:1 | 1,276:1 |
| Perplexity | 289:1 | — |
| 4.7:1 | — |
兩個來源相差一個數量級,且兩者均被保留在此,而非選擇其一,因為它們測量的是不同的網站面板。兩者均未被引用為the比例。在分歧中倖存的是形狀:AI爬蟲獲取的遠多於它們返回的,而谷歌每爬取一個頁面返回的流量比任何其他爬蟲都高出數量級。
這是一個真正支持阻斷訓練爬蟲的論點,那些擁有真實帶寬成本和內容授權優勢的出版商有理由提出這一點。但這並不是阻斷檢索爬蟲的論點——而這正是常見的默認設置實際上為你做出的決定。
一個可辯護的默認策略
大多數銷售產品而非授權內容的組織,都會大致處於相同的位置。
- 允許所有檢索和用戶行為爬蟲。 OAI-SearchBot, Claude-SearchBot, PerplexityBot, ChatGPT-User, Claude-User, Googlebot。這些是唯一能夠產生引用或訪問記錄的爬蟲。除非你故意隱藏內容,否則阻斷它們沒有任何好處。
- 原則上決定訓練爬蟲,而非基於流量。 GPTBot, ClaudeBot, CCBot, Google-Extended。允許它們是押注未來模型內存中存在,雖然真實但無法測量且緩慢。阻斷它們目前沒有任何可觀察的成本。兩種選擇都是可辯護的;選擇一種並寫下理由。
- 阻斷沒有答案表面的爬蟲。 Bytespider及類似不引用也不轉發的爬蟲。沒有任何內容被放棄。
- 在邊緣進行驗證,而不僅僅是基於
robots.txt。 確認CDN、WAF和爬蟲管理規則與該文件一致。這通常是政策被違背的地方。 - 每季度重新檢查。 用戶代理會新增,平臺默認設置會變化,安全審查可能在一個提交中就推翻整個設置。爬蟲訪問是一個需要持續監控的狀態,而不是一個可以完成的任務。
注意第2步中的不對稱性。阻斷訓練爬蟲的成本是不可觀察的;阻斷檢索爬蟲的成本是立即且對那個引擎完全的。當一個決策有一側是可測量的,另一側是不可測量的,應將可測量的一側放在前面。
為什麼llms.txt不屬於這個範疇
它在每一次爬蟲討論中都會被提及,因此值得解決。
谷歌於2026年6月更新的文檔指出,llms.txt不會影響搜索排名或AI概覽,且谷歌搜索關係負責人約翰·穆勒表示,沒有任何AI爬蟲聲稱該文件會提取信息。在採用情況方面,SE Ranking對30萬個域名的研究發現,有10.13%的域名包含llms.txt,而Ahrefs對13.7萬個網站的研究發現,截至2026年5月,有97%已發佈的llms.txt文件流量為零。
發佈一個文件是無害的。將其計入AI可見性工作是不恰當的,因為它取代了真正決定你是否能被引用的爬蟲訪問檢查。一個沒有爬蟲讀取的文件,無法替代每一個爬蟲都遵守的Disallow行。
這些內容都無法帶來實際收益
爬蟲訪問是前提,而不是槓桿。可被獲取意味著可以引用;但它並不意味著很可能被引用,也沒有任何人能保證某個AI答案中會出現引用或位置。不同的引擎對它們抓取的頁面所採取的處理方式差異巨大——Perplexity的來源列表遠比ChatGPT的穩定,而谷歌的兩個界面彼此之間也存在矛盾。阻斷決策也無法事後逆轉:當爬蟲被阻斷期間,一個頁面被排除在索引之外,期間並未被引用,而重新抓取的運行是按照操作員的計劃進行,而非你的計劃。
Lifewood的應對方式
Lifewood在任何AEO或GEO項目啟動前,都將爬蟲訪問作為第一道關口,因為如果內容工作針對的是引擎無法抓取的頁面,那麼將沒有任何回報。該檢查是基於證據而非聲明性的:用戶代理讀取的robots.txt,邊緣和WAF規則分別讀取,並檢查服務器日誌中對OAI-SearchBot、PerplexityBot和Googlebot的實際200響應——文件中的許可是一種聲明,而日誌行才是證明。
關於訓練爬蟲的問題被視為客戶政策決策,而非技術默認設置,並附上其理由,以便後續的安全審查不會默默逆轉這一決定。渲染檢查在同一流程中進行,因為一個執行不運行JavaScript的檢索爬蟲,無論robots.txt允許與否,都會讀取一個空頁面。參見AEO服務,GEO服務,AEO和GEO提供商以及哪些內容會被AI答案引擎引用。
資料與進一步閱讀
- 技術檢查員,robots.txt AI爬蟲阻斷報告,2026年7月27日解析4,223個文件。
- 數字應用,2026年AI爬蟲與機器人流量統計,基於Cloudflare Radar數據。
- 數字應用,AI爬蟲訪問控制:2026年決策矩陣。
- Google搜索關係在llms.txt中的內容,2026年6月,通過Baseline Labs提供。
- SE排名和Ahrefs llms.txt採用研究,由數字應用報告。