簡短回答。 機器人標註並不是自動駕駛標註的簡單放大——它是一項不同的工作。
駕駛數據要求你命名場景中存在什麼。機器人數據則要求你描述一對手在每一幀中對物體進行的三維操作,從操作者的視角出發。這意味著需要精細的手部姿態標註、接觸狀態轉換、任務與子任務分割,以及說明物體哪些部分可以被操作及如何操作的“可操作性”標註。這項工作更慢、更昂貴,也更難做對。同時,這也是需求增長最快的部分。
為什麼機器人數據突然變得如此龐大?
因為類人機器人不再只是演示產品。一旦機器人進入真實倉庫並按照實際生產計劃運行,瓶頸就從模型架構轉移到了數據——而數據必須由人工來收集。
規模擴張可以從多個方向同時觀察到。2026年1月,Figure AI報告稱其BotQ設施已交付超過350臺Figure 03機器人,將生產效率從每天一臺提升至每小時一臺。特斯拉在同一月份在弗裡蒙特啟動了Optimus Gen 3的生產。行業分析師直言不諱地指出,2026年企業級物理AI項目的主要制約因素已不再是架構或算力,而是數據質量和覆蓋範圍——並且在模擬規模達到十倍的情況下,基於精心整理的真實世界演示數據訓練的模型,其表現已超越僅基於模擬數據訓練的模型。
需求側的興趣也在不斷上升。2025年5月美國每月搜索量‘physical AI’約為1,900次,到2026年4月已增至6,600次——十二個月內增長了3.5倍,這一增長主要由類人機器人項目、開源政策發佈以及工廠級數據管道取代被動網頁爬取所驅動。根據服務於這些買家的市場,他們實際採購的是以操作者為中心的視頻、遠程操作軌跡、操作演示和評估集,並附帶商業權利和同意文件。
在Lifewood,我們觀察到這正轉變為客戶提問方式的轉變。兩年前,一個關於機器人的諮詢通常會涉及LiDAR和邊界框。如今,它往往從可穿戴設備、手部追蹤和接觸狀態開始,並幾乎總是以‘我們能收集多少個國家和廚房’的問題結束。
標註中的以自我為中心(egocentric)標註實際上涉及什麼?
對機器人將看到的內容進行標註。這個單一約束重塑了所有下游環節。
一旦你聽到這個推理,它的邏輯就非常直接。在第三方視角視頻上訓練的模型學會從外部識別動作;在第一人稱視角視頻上訓練的模型則學會執行這些動作。第三方攝像頭展示了場景,卻錯過了手部、接觸的瞬間,以及機器人在接近時實際看到的精確像素。以自我為中心的視頻自然與機器人搭載攝像頭的視角對齊,因此它已成為在不額外購買更多機器人的情況下擴展操作數據集的高效方式。
由此產生的數據集規模巨大,其中一項尤其重新設定了預期。
蘋果公司利用Vision Pro構建了EgoDex:829小時的30Hz以自我為中心視頻,覆蓋了194個桌面操作任務,每個幀對雙手的25個關節都進行了SE(3)標註,這些標註通過校準攝像頭和視覺-慣性SLAM在設備端完成。它集成了語言標註、相機外參和靈巧操作標註——這是此前所有數據集都沒有提供的組合。
其他團隊則採取了相反的路徑並開始工作。Egocentric-1M於2026年4月發佈,記錄了2153名工廠工人在真實工業現場的活動:10.8億幀1080p和30fps的視頻,總容量達16.4TB,這是首個完全在工廠而非家庭或實驗室中收集的以自我為中心數據集。EgoVerse由包括佐治亞理工學院、斯坦福大學、加州大學聖地亞哥分校、蘇黎世聯邦理工學院、麻省理工學院和Meta Reality Labs在內的聯盟貢獻,涵蓋1362小時、1965項任務、240個場景和2087名演示者,來自多個國家,通過多機器人協同訓練實現了高達30%的性能提升。EgoScale則展示了人類數據量與驗證損失之間的對數線性縮放規律,且該損失與下游機器人性能高度相關。
最後這一發現具有商業意義。它實際上意味著:更多的人類演示標註,確實能帶來更優秀的機器人——因此,容量已成為瓶頸。
機器人標註所要求的內容,而駕駛標註從未要求過:標註員產出的內容為何重要?對政策的影響?手部姿態 每幀雙手的3D關節位置,逐指精確標註 精細程度遠超僅追蹤手腕或抓手的方案 藉助硬件輔助,需反覆審核 接觸狀態 每個物體接觸開始和結束的精確幀 無法從自身視角檢測接觸的策略在放置任務中會失敗 真正的模糊性 視線與目標之間的空間關係 演示者注視的方向;抓手與目標的空間關係 接近階段的錯誤會導致抓取失敗 任務分割 原子級動作邊界和自然語言描述 使語言條件策略能將指令映射到動作 對指南敏感的 物體上哪個區域允許何種動作,以及如何抓取 使模型能夠泛化到訓練中從未見過的對象 這是所有標籤中最難的部分 這些標籤均來自同一段視頻,但每個標籤都有其自身的失敗模式、指導原則和審核人員。將它們視為一個任務,是我們最常見的錯誤。
為什麼‘可及性’標註是最難的部分?
因為其定義本身存在爭議,而大多數數據集都以相同三種方式錯誤地處理了這一點。
功能是指行動的可能性——一個給定物體基於其物理屬性和操作者的運動能力,允許該操作者執行哪些動作。在理論上是可行的,在實踐中卻存在漏洞。東京大學的研究人員在提出一種用於第一人稱動作視頻的標註方案時,指出了現有數據集中的三個常見問題:他們將功能與物體的功能性混淆;將功能與目標相關動作混淆;完全忽略了人類的運動能力。他們提出的解決方案是將與目標無關的運動動作與抓握類型作為標籤,並引入機械動作的概念,以捕捉兩個物體之間可能發生的動作。
將上述內容視為一個標註需求說明,其含義會迅速顯現。刀具的功能是切割。它的功能包括握持刀柄、用刀刃夾持進行交接、以及用掌心按壓。這些都是不同的標籤,如果指南沒有將它們分開,那麼最終數據集中‘刀’一詞將意味著每個標註員當天所理解的含義。更廣泛的領域直接承認這一缺陷:功能研究仍面臨數據稀缺、泛化能力差以及難以應用於現實世界的問題,尤其缺乏大規模功能數據集並帶有精確分割圖譜。
從第一人稱視頻中自動提取功能正在發展,且應被使用。但這種自動提取同樣面臨定義問題——自動流程的連貫性取決於其構建所依據的標籤方案。這一點正是人工參與閉環的價值所在。
實踐中有效的做法,以及項目容易受阻的環節
為每個標籤類型制定獨立的指南,而非一份涵蓋所有五類的文檔
將‘可及性’視為‘物體功能’的同義詞
在數據採集前就達成並闡明抓握分類
模糊的接觸幀通過靜默方式解決
由第二位評審員對接觸狀態進行裁定
示範者群體僅來自一個國家或一個體型
同步多模態採集:視頻、深度、音頻、目光
多樣化的場景和示範者——場景、廚房、工廠、國家
在源頭捕獲知情同意文件和商業權利
一名標註員在同一片段上標註所有五種類型
僅在實驗室進行的採集,從未看到真實工作空間
在交付後才發現第一人稱視頻中包含PII。機器人在窄範圍示範者多樣性上訓練,其泛化能力大約相當於預期水平。
人類示範者是傳感器。應像對待一個工具一樣招募和校準他們。
在擴大規模前,團隊應該確保哪些方面是正確的?
那些不引人注目的部分,而且往往比必要時間更早地進行。
有兩個約束值得命名,因為它們會讓人感到意外。第一個是隱私:第一人稱視角視頻記錄了佩戴者所看到的一切內容,包括他人面部、屏幕和文件,這些內容並未獲得相關方的同意。端到端的個人身份信息(PII)移除、合規存儲以及完整的審計追蹤,已成為企業買家的標配,ISO 27001 和 SOC 2 現在已不再是採購機器人系統的差異化因素,而是基本要求。在數據採集之後進行補救是痛苦且有時根本不可能的。
第二個是場景和示範者的多樣性。一個在單一實驗室由二十名研究生採集的數據集,會產生僅在該實驗室有效的一項策略。推動真正進展的數據集則走向相反方向——數千名示範者、數百個場景、多個國家。這首先是一個物流問題,而非標註問題,而這正是我們覆蓋30多個國家的交付網絡所專門設計的工作:在真正不同的廚房、車間和倉庫中招募示範者,並使用本地語言進行簡報,以確保任務指令在各地具有相同的含義。
在任何採集之前,先編寫功能方案。明確區分功能、目標相關動作和運動功能,並提前完善抓握分類方案。
將五種標籤類型分配給專門的評審員。手部姿態、接觸、目光、分割和功能各自需要獨立的指南和獨立的黃金標準集。
對接觸幀進行裁決。接觸開始的精確位置是整個流程中最具爭議的標籤;需要第二雙眼睛和一份書面的裁決規則。
有意識地設計演示多樣性。手性、手大小、身高、工作方式、文化背景和環境都會影響政策的形成。
在採集時刻就獲取同意和權利。商業使用權利和貢獻者同意的記錄成本遠低於事後重建。
將個人身份信息(PII)移除作為流程的一部分,而不是流程之後進行。第一人稱視頻內容遠超任務本身。
使用自動化預標註進行姿態標註,使用人工標註進行接觸和可及性標註。發揮每種方法最可靠的優勢。
保持仿真與真實數據之間的誠實性。經過精心篩選的真實演示數據,即使在規模達到仿真數據十倍的情況下,也已超越僅基於仿真的訓練表現。
關鍵要點
- 機器人標註是一個與駕駛標註不同的學科,而不是駕駛標註的更大版本。
- 2026年物理-人工智能項目中的瓶頸是數據質量和覆蓋範圍,而不是架構或計算能力。
- 第一人稱視頻之所以重要,是因為它與機器人搭載攝像頭所看到的內容一致:第一人稱視頻教機器人執行動作,第三人稱視頻教機器人識別環境。
- EgoDex 樹立了新標杆:33.8 萬條軌跡、194 項任務、9,000 萬幀,併為雙手的 25 個關節提供逐幀 SE(3) 標註。
- EgoScale展示了人類數據量與驗證損失之間對數線性關係,損失與機器人性能呈相關性。
- 從同一段視頻中可以提取五種標籤——手部姿態、接觸狀態、目光與接近度、任務分割、可及性——每種標籤都需要獨立的指導方針。
- 可及性是最難處理的:數據集通常將其與物體功能或目標相關動作混淆,並忽視人類的運動能力。
- 經過精心篩選的真實演示數據,即使在模擬數據規模達到十倍的情況下,也已超越僅基於模擬的訓練表現。
- 個人身份信息(PII)處理、同意記錄、ISO 27001和SOC 2是機器人採購中的基本要求,而非差異化因素。
資料與進一步閱讀
- Hoque等人, "EgoDex:從大規模第一人稱視頻中學習靈巧操作", arXiv:2505.11709, 表1——數據集對比;33.8萬條軌跡,194個任務,9000萬幀,語言標註,相機外參和靈巧操作標註
- "Qwen-RobotManip 技術報告", arXiv:2606.17846, §2.2 — 人手的自中心數據與機器人安裝攝像頭視角對齊;EgoDex 捕獲細節(Apple Vision Pro,829 小時,30 Hz,25 個關節的 SE(3),視覺-慣性 SLAM)
- Yu, Huang, Furuta, Yagi, Goutsu & Sato(東京大學),"自中心動作視頻數據集的精確功能標註", arXiv: 2206.05424 — 三種反覆出現的標註錯誤以及動作-抓取類型方案
- "從自中心視頻中學習精確功能以實現機器人操作", arXiv:2408.10123 — 關於功能研究中的數據稀缺性、泛化能力差和部署困難問題
- 數字鴻溝數據,"為何以自我為中心的數據集正成為訓練機器人模型的新標準"(2026年7月)——基於EgoScale在20,854小時內的對數線性縮放規律、EgoVerse聯盟的數據構成,以及最多30%的跨身體表現提升,以及接觸/目光/接近度監督信號。digitaldividedata.com/blog/why-egocentric-datasets-are-becoming-the-new-standard-for-training-robotics-models Labellerr,"2026年10個以自我為中心的數據集正在重塑機器人與人工智能"——Egocentric-1M的詳細信息(2,153名工廠工人,10.8億幀,16.4TB)和EgoVerse的構成
- Labellerr,《2026 年面向機器人的 7 家領先第一視角數據服務商》:討論第一人稱與第三人稱學習的區別、個人身份信息移除和審計記錄要求,以及多模態同步採集
- MarketsandMarkets, embodied AI市場 — 2025年為44.4億美元,到2030年將達到230.6億美元,複合年增長率39.0%。marketsandmarkets.com/Market-Reports/embodied-ai-market-83867232.html SNS Insider, 物理AI市場 — 2025年為52.3億美元,到2035年將達到874.3億美元,複合年增長率32.53%
- Kaiso Research,《物理 AI 合成數據市場》:市場規模從 2025 年的 20.3 億美元增至 2035 年的 639.5 億美元,複合年增長率為 41.25%;NVIDIA《物理 AI 數據工廠藍圖》,2026 年 3 月。kaisoresearch.com/report-store/global-synthetic-data-for-physical-ai-market。MarketsandMarkets,《人形機器人市場》:Figure AI 的 BotQ 產能提升(超過 350 臺 Figure 03,每小時生產 1 臺)及 AGIBOT WORLD 2026 高接觸交互數據集。marketsandmarkets.com/Market-Reports/humanoid-robot-market-99567653.html。Truelabel,《物理 AI 數據交易平臺》(2026):討論 2025 年 5 月至 2026 年 4 月期間,美國對“physical AI”的搜索需求增長 3.5 倍(每月從 1,900 次增至 6,600 次),以及採購方購買的具體內容
- DataX Power, "2026年最佳機器人訓練數據服務" —— 數據質量和覆蓋範圍是2026年的關鍵限制因素,且經過精選的真實演示數據在規模上遠超模擬數據,達到十倍之多
- Data Science Society, "2026年物理AI與機器人領域最佳數據標註公司排名7" —— ISO 27001和SOC 2作為企業基礎要求,物理AI標註與標準圖像標註存在差異。datasciencesociety.net/7-best-data-annotation-companies-for-physical-ai-robotics-in-2026 Lifewood, AI數據,物理AI與標註服務
- 圖1和圖2中的圖表由Lifewood根據下文每張圖表引用的來源數據製作而成。