跳轉到主要內容
AI 數據

計算機使用GUI代理訓練所需的數據

短答案。四個層面:用於教會模型閱讀界面的屏幕理解數據,將指令映射到具體像素的定位數據,多步軌跡數據……

Mumu D. · 2026年7月17日 · 閱讀約 10 分鐘

簡短回答。 包含四個層面:用於教會模型閱讀界面的屏幕理解數據,將指令映射到具體像素的定位數據,展示UI狀態隨操作演化的多步軌跡數據,以及用於解釋每一步原因和獎勵信號的推理軌跡數據。數據來源涵蓋專家人工演示、合成探索、挖掘的教程和教學視頻——研究始終指向一個結論:經過仔細驗證的人類數據,優於規模更大但未經驗證的語料庫。


計算機使用代理實際上在學習什麼?

一個感知到行動的循環——看到屏幕,找到目標,執行操作,並跟蹤變化——而訓練數據正是沿著這些關鍵環節進行分解的。

計算機使用代理是一個被要求完成網頁語料庫無法直接教授的任務的視覺-語言模型:觀察渲染後的界面,將如‘導出報告為PDF’這樣的指令連接到數百個元素中的一個特定按鈕,執行低層級操作——點擊、輸入、拖拽、滾動——然後理解該操作所產生的新屏幕,連續數十次執行,且不丟失任務主線。該循環中的每個能力都可能獨立失敗:代理可以完美描述屏幕內容,卻仍會點擊目標左側40像素的位置;它可以精確地定位點擊目標,卻對實現目標所需的操作序列一無所知;它可以執行已知的操作序列,但一旦彈出窗口改變狀態,就會立即崩潰。

因此,GUI代理的訓練數據並非單一數據集,而是一個層級堆疊結構。研究社區已達成共識,其分解方式與上述循環完全對應:用於感知的識別數據,用於目標定位的定位數據,用於多步執行的軌跡數據,以及用於規劃與判斷的推理與獎勵數據。

像ScaleCUA這樣的框架使這一層級結構變得顯式,即在任何訓練運行開始前,將一組共享的截圖和元數據標註到這些具體任務類別中——因為模型最薄弱的層級,而非其平均表現,決定了它在真實桌面環境中的實際能力。

四層GUI訓練結構 1 2 3 4 推理與獎勵 感知 精準定位 多步軌跡 元素描述、OCR識別、空間佈局、界面及屏幕過渡說明 指令到像素:點擊的點定位、區域的邊界框、命令的行動定位 多步場景——截圖、操作及參數——展示UI狀態如何逐步演化至目標 步級推理解釋‘為什麼’,以及經過驗證的獎勵信號用於強化學習後訓練 每一層都在訓練不同的失敗模式:感知、定位、執行和判斷在實際部署的代理中獨立失效。


四種核心數據類型是什麼?

理解教人閱讀;定位教人瞄準;軌跡教人操作;理由和獎勵教人決策。

屏幕理解數據。在代理執行任何操作之前,必須解析:描述元素的外觀,提取其文本(引用OCR),推斷其功能和背後的意圖,總結整個界面,以及對比兩張截圖之間的變化並生成描述。ScaleCUA的標註規範將這些內容形式化為元素級和截圖級任務,包括屏幕過渡描述——即注意到點擊打開了一個對話框——這一技能是所有下游任務的基礎。

定位數據。定位將語言映射到屏幕座標,分為三種類型:點定位(精確點擊位置)、邊界框定位(用於選擇類操作的區域)和動作定位(將空間目標連接到其底層操作命令)。該數據集生態豐富——SeeClick、UGround、OS-Atlas、Aria-UI 和 ScreenSpot-Pro,其在23個專業行業中的1,581個高分辨率任務揭示了密集專家軟件界面比消費者網頁複雜得多。桌面端的突出代表是GroundCUA:基於87個應用中12個類別的專家人工演示,包含56K張截圖,每屏元素均被標註——超過356萬條經人工驗證的標註。

軌跡數據。軌跡是完整的場景——指令、截圖、帶參數的動作、一步步展開——它們教會代理界面是具有狀態的。標準數據集均來自人工演示:Mind2Web用於網頁任務,AITW用於安卓端大規模任務,GUI-Odyssey包含7,700個移動端場景,覆蓋跨應用流程,AndroidControl和JEDI則通過低層級動作描述補充步驟,將意圖與可執行操作連接起來。魯棒性變體現在增加了現實中的混亂因素:一個基準測試在七種異常條件下收集了10,000多個動作序列——包括遮擋、動態內容變化——因為實際部署的屏幕很少像乾淨的截圖那樣表現。

推理與獎勵數據。最新的層級訓練‘為什麼’:記錄演示者觀察、規劃和預期的逐步驟自然語言理由——這是AITZ、AgentTrek、OSGenesis和Aguvis等項目背後的方法——以及強化學習中的獎勵信號,從學習到的獎勵模型到近期訓練後使用的部分可驗證獎勵。TongUI展示了重構模式:通過提示模型為256K個現有樣本生成一致的‘思考’內容,並在點擊元素上添加視覺標記,確保推理與動作不偏離。


數據來自哪裡——人類、合成、教程、視頻?

四條數據供應線,其經濟特性相反——而該領域最近最清晰的發現是,經過驗證的人類數據其規模雖小,但價值遠超其體量。

人工演示設定了保真度的基準。最初的訓練數據集——Mind2Web、AndroidControl、GUIOdyssey——都是由人們執行真實任務構建而成,因此它們捕捉到了自然的交互模式,而非隨機點擊。GroundCUA的協議是現代範本:標註員設計日常任務,反映常見的目標,然後在開源應用中實際執行,每一個元素都經過人工驗證標註。其代價是整個領域所圍繞的約束——每次專家演示成本高昂——但回報如今已可衡量:GroundNext在該專家驅動數據上訓練後,其表現與在大量數據上訓練的模型相當甚至更優,作者得出結論:高質量、由專家驅動的數據集在推動通用計算機使用代理方面發揮著關鍵作用。

合成管道實現了規模擴展。為擺脫數據採集成本,OS-Genesis通過由學習到的獎勵模型引導的代理驅動探索提取軌跡;WebSynthesis在模擬的網頁界面中運行世界模型引導的搜索;GUI-ReWalk結合了隨機探索與意圖感知推理;而互聯網級的合成管道已產生94,000條成功的網頁軌跡,覆蓋49,000個URL和720,000張截圖,且完全沒有人工標註。論文中明確指出了這一權衡:合成數據提供了覆蓋範圍和數量,但需要驗證層,因為沒有人親眼見證其生成過程。

教程和視頻是尚未受到充分重視的數據來源。互聯網上已經存在數百萬段軟件使用演示,只是尚未被標記為訓練數據。TongUI 從多模態網絡教程中挖掘出 14.3 萬條可執行軌跡;VideoAgentTrek 則通過識別視頻中的動作並重建相關步驟,將 39,000 段未標註的教學視頻轉化為 152 萬個推理與動作步驟,約合 260 億個訓練詞元。它最終的數據組合體現了當前實踐:約 260 億詞元來自視頻,80 億來自經過統一處理的人工演示,10 億來自有針對性的定位配對數據。規模來自現有數據的挖掘,保真度來自人工數據,精度來自定位數據。

強化學習環境實現了閉環。像OSWorld這樣的基準同時充當訓練場地:在可執行環境中進行強化學習訓練——任務成功可被驗證——始終能超越模仿,這使得可驗證的任務定義和獎勵函數成為一種獨立的數據類型。

一種真實預訓練混合——以及領域對質量的發現 視頻衍生交互步驟(VideoAgentTrek)

~26B tokens 協調的人類演示(OpenCUA, Aguvis)

~8B tokens 聚焦的GUI實體對(OSWorld-G子集)

約 10 億詞元。與此同時,質量勝過數量:GroundCUA 包含來自 87 個桌面應用專家演示的 356 萬條人工驗證元素標註。表現達到或超過同等水平:使用這些專家數據訓練的 GroundNext,能夠匹敵或超越使用多得多的數據訓練的模型。GUIOdyssey 包含 7,700 段人工演示的移動端操作,其中包括合成方法仍難以模擬的跨應用流程。詞元組成來自 VideoAgentTrek 公佈的語料庫;質量方面的發現來自 GroundCUA 與 GroundNext 論文。


這裡的‘質量’指的是什麼,它是如何產生的?

像素級精確、狀態感知、由第二位人工驗證——並覆蓋了實際桌面系統運行的各類平臺、行業和語言。

錯誤容限極為嚴格。在大多數標註工作中,稍微寬鬆的標籤就會削弱統計結果;在GUI數據中,一個20像素寬的邊界框會教模型點擊錯誤的控件,而軌跡中一個錯誤標註的步驟則會汙染其後所有內容,因為每個動作都會影響下一個狀態。因此,最強的數據顯示其流程強調專家示範、逐元素驗證和截圖級審查——而‘人工驗證’在數據集摘要中成為賣點,而非腳註。

覆蓋範圍是一個質量維度,而非附加福利。在消費者網頁上訓練的智能體在專業軟件環境中會表現失常——這正是ScreenSpot-Pro 23個行業基準所要暴露的差距——如今的數據集已刻意涵蓋Windows、macOS、Android和網頁平臺,以及遮擋、動態內容等異常情況。最隱蔽的差距是語言層面:界面存在於所有文字系統和區域,教程與演示嚴重偏向英語,一個僅見過英語標籤的智能體實際上從未真正見過世界大部分屏幕。

這是在工業規模上的示範工作——而這正是供應鏈介入的地方。

每一個‘專家驅動’的數據集背後,都存在一個實際操作問題:如何招募熟悉軟件的人、讓他們完成自然任務、標註他們接觸的每一個元素,並獨立驗證結果。這正是AI數據服務工作的本質——這也是Lifewood從行業一側提供的服務形態:在30多個國家的交付中心開展任務示範與數據採集,覆蓋文本、圖像和交互數據的逐元素標註,支持50多種語言的本地化覆蓋,以應對當前數據集普遍缺失的區域,並採用公司特有的雙重人工參與閉環審查機制——第一遍生成示範,第二遍獨立驗證每一個標籤與屏幕內容的一致性——嚴格滿足本類別所需的逐元素標準。此外,還有一條生產規則至關重要:真實工作場景的截圖能真實反映信息,因此個人身份信息(PII)清理和用戶同意必須在任何單幀進入訓練流程之前完成。

關於數據量的提醒。上述數據集規模、token數量和研究發現均來自引用的論文和代碼庫,描述的是特定數據集和模型的結果;諸如‘與訓練數據更多的模型匹配’這類結論是作者針對特定基準提出的斷言,而該領域發展迅速,今年的前沿水平可能就是明年的新基準。在使用任何具體數值前,請務必查閱原始論文——所有論文均公開可查。


關鍵要點

    • 計算機使用智能體學習一個循環——讀取屏幕、定位目標、執行操作、追蹤變化——而訓練數據也沿著相同的結構分解:理解、定位、軌跡和推理加獎勵。
    • 數據理解涵蓋元素描述、OCR識別、佈局信息以及屏幕切換標題的標註;定位數據將指令映射到具體點、框和操作——以ScreenSpot-Pro為例,展示了專業級軟件的複雜性遠超消費級網頁工具。
    • 軌跡數據教授狀態感知:如Mind2Web、AITW、GUI-Odyssey(7,700個跨應用場景)和AndroidControl這類由人類演示構成的語料庫,至今仍是保真度的行業標準,如今進一步擴展至遮擋和動態內容等異常場景。
    • 推理軌跡(AITZ、OS-Genesis、Aguvis、TongUI生成的思考過程)和可驗證的強化學習獎勵構成了最新一層——解釋每一步操作的原因,並在訓練後通過迭代優化提升對模仿的超越能力。
  • • 供應來自四條具有相反經濟特性的路徑:昂貴的高保真人類演示、可擴展的合成探索(最多可達94K條軌跡且無需人工標註)、挖掘的教程(TongUI的143K條)、以及教學視頻(VideoAgentTrek的39K個視頻 → 約26B個token)。
    • 該領域最清晰的近期發現傾向於質量優先:GroundCUA的356萬條經人類驗證的標註數據訓練出的模型,其性能或可媲美甚至超越那些在數據量上遠超其規模的系統。
    • 本類別的質量意味著像素級準確的標籤、狀態一致的軌跡、獨立的人類驗證、跨平臺和跨行業的覆蓋範圍——以及填補大多數語料庫忽視的多語言鴻溝。
    • 其生產過程是工業級的演示與標註工作:招募熟悉軟件的用戶,捕捉自然任務,按元素進行標註,通過二次驗證,並在任何訓練前清除個人身份信息(PII)。
    • 所有圖表均為特定論文所限定,該領域每季度更新一次——在使用任何數值前,請務必閱讀所引用的論文。

資料與進一步閱讀

常見問題

並非完全如此,根據現有證據。合成探索提供了規模和覆蓋範圍,但最近最有力的定位結果來自專家人工演示並逐元素驗證——而基於這些數據訓練的模型,其表現與基於更大語料庫訓練的系統相當。目前有效的做法是融合兩者:獲得規模,確保真實性。

標註是單步操作:指令輸入,座標輸出。軌跡數據則是完整的一系列場景——跨越多個步驟的截圖、操作和參數——用於教學界面狀態如何演進。

沒有理由的操作只會教模型模仿,而不是判斷。每一步的思考——演示者所看到、計劃和預期的內容——為模型提供了可泛化的決策過程,這也是為什麼近年來訓練方案中,帶有理由的標註數據集和思考生成補丁已成為標準。

已發表的方案範圍從幾百萬條標註和軌跡樣本,到包含視頻預訓練的數十億tokens不等——但GroundCUA/GroundNext的結果重新定義了這個問題:一旦達到合理規模,數據的組成和驗證質量比原始數量更重要。

真實使用場景的截圖會捕獲屏幕上的一切內容——姓名、郵箱、文檔、賬戶信息等。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊