簡要回答。非洲擁有超過 2,000 種語言,接近全球語言總數的三分之一;但根據 Joshi 等人的分類,其中 88% 在計算語言學中嚴重缺乏代表性,或被完全忽視。2025 年的一項 PRISMA 綜述發現,五年間公開發表的 ASR 數據集僅有74 個,覆蓋 111 種非洲語言,總計約 11,206 小時,其中不到 15% 可以復現。這一差距並非由使用人數決定:豪薩語約有 8,000 萬使用者,阿姆哈拉語約有 6,000 萬,斯瓦希里語遠超 1 億。NLP 中排名前 100 的語言覆蓋了約 96% 的全球 GDP,卻覆蓋不到 60% 的世界人口,而商業關注跟隨的是 GDP。改變這種情況,需要建設非洲本地能力:60% 的人口年齡低於 25 歲,每年約有1,200 萬人進入勞動力市場。
關於非洲語言與AI的一個統計數據,我不斷回到它,因為它每次都會重新定義問題的本質。
非洲擁有超過2000種語言,接近地球上所有語言總數的三分之一。根據Joshi等人分類標準,該領域已成為標準參考,88%的非洲語言在計算語言學領域嚴重缺乏或被完全忽略。
並非未被服務。並非落後。被忽略。
這一差距並非抽象的研究問題。它決定了尼日利亞北部的農民是否能使用語音助手查詢農作物價格,坦桑尼亞農村的患者是否能獲得其實際使用的語言中的健康信息,塞內加爾的學生是否能使用與里昂學生相同的教育工具。而這一差距無法通過更好的模型架構來解決。它只有在有人親自去收集數據時才能被填補。
Lifewood在最近擴張中,將交付中心拓展至非洲,同時在馬來西亞和印度尼西亞推進AV項目,並建立了美國站點。本文旨在說明這一決策在運營層面的重要性,非洲大陸真實的語言圖景是什麼,以及當進行標註的人員居住在語言實際使用地時,情況會發生怎樣的變化。
缺失內容的規模
讓我用一些具體數字來說明這一差距,因為抽象的表述掩蓋了其嚴重程度。
一篇於2025年發表的系統性文獻綜述,遵循PRISMA方法論,涵蓋2020年1月至2025年7月期間的研究成果,全面梳理了非洲語言自動語音識別領域的已發表研究全景。在71項符合納入標準的研究中,研究人員共發現了74個數據集,覆蓋111種語言,總計約11,206小時的語音數據。
一萬一千小時。覆蓋111種語言。跨越五年已發表研究。
相比之下,一個資源充足的商業英語自動語音識別(ASR)系統,可能為單一語言使用數萬小時的數據。整個非洲語言語音語料庫,涵蓋超過一百種語言,其總量甚至不及一個嚴肅的英語項目所消耗的數據量。
與此同時,該綜述還發現,少於15%的研究提供了可復現的數據材料,且數據集的許可條款通常不明確。因此,即使目前存在少量數據,也往往無法被下一個需要使用它的團隊實際應用。
與此同時,大約有814種非洲語言被歸類為瀕危語言。尼日利亞單獨就有171種語言面臨最嚴重的威脅,喀麥隆有75種,科特迪瓦有65種。這些語言的記錄窗口正在關閉,而支持它們的AI系統卻在沒有這些語言參與的情況下被構建出來。
為何這一差距依然存在,且並非大多數人所理解的那樣
顯而易見的解釋是,這些是小語種,至今尚未有人著手研究。這一解釋在兩個方面都是錯誤的。
它們並非小語種。豪薩語大約有8000萬使用者,約魯巴語和伊博語各自擁有數千萬使用者,阿姆哈拉語約有6000萬使用者,斯瓦希里語作為東非的通用語言,使用者超過1億,包括第二語言使用者。這些語言並非在孤立社區中使用的冷門語言,而是主要經濟體的官方語言。
而且這並非一個排隊等待的順序。AI4D非洲語言項目明確指出:在自然語言處理(NLP)領域中,前100種語言覆蓋了全球約96%的GDP,但僅佔全球人口的不到60%。受到關注的語言,是那些與商業回報掛鉤的語言,而非使用者最多的語言。正如該項目作者所言,非洲語言對推動NLP的公司而言缺乏經濟吸引力,因此相關工作必須由非洲研究人員來承擔。
這是結構性現實,它解釋了迄今為止所構建成果的重要特徵。迄今為止,最重要的非洲語言資源主要來自基層和學術倡議,而非商業項目:
Masakhane,自2019年起由非洲技術從業者組成的基層組織,持續創建數據集和模型;AI4D非洲語言項目發起的眾包挑戰和研究員獎學金計劃;非洲語言實驗室;由非洲研究人員構建的IrokoBench和AfroLID等基準測試。
這些工作由與語言密切相關的人員完成,大多未獲得商業資金支持。所缺失的是生產能力:即能夠根據客戶要求,交付500小時經驗證的沃洛夫語語音數據、約魯巴語指令微調數據或阿姆哈拉語紅隊數據,並在規定時間表內以商業化規模、具備可追溯質量保證交付的能力。
非洲大陸實際上擁有的是:人才論點
這是大多數關於非洲AI數據工作的討論中被低估的部分,這些討論往往聚焦於成本。
非洲有60%的人口年齡在25歲以下,使其成為全球最年輕的大陸,每年大約有1200萬年輕人進入勞動力市場。移動電話用戶數量約為4.95億,且持續增長,智能手機使用率穩步上升。肯尼亞的技術生態體系獲得了"硅谷之南"的稱號;尼日利亞人口超過2.2億,支撐著一個龐大的技術產業;南非擁有成熟且發達的金融與專業服務市場。
標註工作實際意味著需要一個龐大、年輕且數字素養高的勞動力隊伍,他們通常默認是多語言的。一位尼日利亞的標註員可能在家中說約魯巴語,在專業場合說英語,在社交場合使用尼日利亞皮欽語,並通過地區接觸瞭解豪薩語或伊博語。這種組合在大陸之外真正難以找到,而這正是多語言標註項目所需要的。
這也意味著質量方面的問題,而那些只關注成本的討論完全忽略了這一點。正確標註約魯巴語需要了解約魯巴語,但要高質量地標註約魯巴語,則需要了解約魯巴語在拉各斯和伊巴丹的實際口語使用情況,哪些語調區別在哪些語境中具有意義,以及何時在英語中的語言切換是自然表達而非違反規範。這種知識無法通過培訓文檔傳遞。
關於勞動力的問題,老實說
任何關於非洲AI標註的工作如果跳過勞動條件的討論,都不值得閱讀,因此我直接來談談這個問題。
東非的數據標註行業曾受到嚴重批評,其中許多批評是合理的。肯尼亞於2026年發佈的《人工智能及其他新興技術政策》草案,專門涉及數據標註、內容審核和AI質量評估崗位。該草案提出了一項公平薪酬參考框架,其基準是國際薪酬水平而非國內最低工資標準,這一差距十分明顯:報告的時薪約為1.46至3.74美元,而美國同等崗位的時薪則為21至27美元。
該草案還提出必須提供心理社會支持、書面合同、透明的薪酬報告以及申訴機制。一篇2026年CHI論文基於對肯尼亞數據工作者的訪談,描述了由不穩定的合同和全球勞動力套利所形成的‘困局制度’。
這是任何在非洲運營的公司必須面對的背景,假裝不知道這是不誠實的。在實際操作中,這意味著工作條款已不再是價值觀聲明,而是採購決策的問題。受歐盟文件義務約束的買家將越來越被要求說明貢獻者是如何被對待的,而不僅僅是交付的內容。
此外,還有一個直接的運營層面的論點,與倫理層面並存。在某些語言中,合格標註員的群體確實非常有限,因此經過培訓的貢獻者在整個供應鏈中是稀缺資源。公平的條款、穩定的工作和職業發展路徑,是交付運營能夠持續為沃洛夫語或提格利尼亞語等語言提供服務的關鍵。在稀有語言項目中的人員流失,不是人力資源指標,而是能力損失,可能需要數月才能重建。
擁有非洲本土中心實際上帶來了什麼改變
這一點我想要具體說明,因為‘我們在非洲設有中心’可能意味著從一個銷售辦公室到一個真正運行的交付中心的各種情況。
招聘範圍。對於像沃洛夫語或奧羅莫語這樣的語言,無法通過全球招聘平臺找到貢獻者。他們只能通過本地網絡、社區組織、大學以及語言使用區域內的口口相傳來接觸到。這需要實地人員瞭解這些網絡。這是項目能夠完成其人員配額與項目在40%時停滯之間的區別。
方言和變體覆蓋。一種語言並不是單一的。內羅畢的斯瓦希里語與達累斯薩拉姆的斯瓦希里語不同。卡諾的豪薩語與尼日爾的豪薩語也不同。一個只從單一地點招募的項目,會生成一個只教授該方言、並將其他方言視為錯誤的數據集。要在實際地理分佈上實現代表性覆蓋,就必須進行跨區域招募,而這需要實地存在。
場條件與部署相匹配。如果一個語音產品將在噪音大、網絡連接不穩定的廉價手機上使用,那麼訓練數據就應該在類似的廉價手機和噪音大的環境中錄製。通過中央工作室遠程採集數據會產生乾淨的音頻,但最終模型在實際使用中卻會失效。
數據本地化與同意。多個非洲司法管轄區的數據保護框架包含跨境傳輸限制,而語音數據若能識別說話者,通常被視為敏感個人信息。在本地採集和處理不僅操作上便利,對某些客戶項目而言更是合規要求。
交付週期。一個擁有穩定電力和網絡連接的區域中心,能夠支持周邊地區的現場數據採集,將基礎設施問題轉化為物流問題。離線採集的錄音可以物理運送到具備帶寬的中心,而不是通過貢獻者薄弱的網絡連接進行傳輸。
Lifewood 在該領域的公開工作包括與一家全球語音AI公司長期的合作關係,涵蓋多語言語音和大語言模型服務,特別擴展了語音AI在低資源亞洲和非洲語言中的覆蓋範圍。這項工作呈現出的形態是:不是一次性數據集採購,而是持續具備能力,將客戶的語言覆蓋延伸到必須本地創建數據而非直接獲取的地區。
未來幾年這將如何呈現
儘管速度尚不明確,但方向已經清晰。
語言覆蓋正從單純的商業考量轉變為政策目標。非洲政府和研究機構正在直接資助語言技術工作,從而催生了一類具有不同需求的新買家:開放性、文檔化和明確的覆蓋要求。
基層研究社區已經建立了基準,使得非洲語言工作可以被量化,而五年前尚不可測。IrokoBench、AfroLID、AfriWOZ 和 Masakhane語料庫家族意味著客戶現在可以評估一個模型是否真的在約魯巴語中有效工作,而不是僅僅因為該語言出現在支持列表中就假設其有效。
同時,商業前景也在改善,隨著可服務市場擴大。非洲以移動為先的經濟意味著本地語言的語音和文本界面具有真實的商業回報,而不僅僅是道德上的考量。
這些都不足以單獨填補差距。真正填補差距的是那些不顯眼的工作:尋找說話者、獲得同意、錄音、轉錄、驗證、裁決和記錄,成千上萬次地在從未有人做過這些工作的語言中重複進行。這項工作必須在這些語言實際被使用的地區進行。最終,這正是我們之所以要在此地存在的全部論據。
關鍵要點
- 非洲擁有超過2000種語言,接近世界總語言數量的三分之一,但根據Joshi等人分類,88%的語言在計算語言學中嚴重缺乏或完全被忽視。
- 2025年PRISMA系統性綜述發現,有74個已發表的語音識別(ASR)數據集覆蓋了111種非洲語言,總計約11,206小時的語音數據,跨越五年研究,其中不到15%提供了可復現的材料。
- 大約有814種非洲語言被列為瀕危語言,尼日利亞面臨171種、喀麥隆75種、科特迪瓦65種的威脅。
- 差距並不在於說話人數:豪薩語約有8000萬使用者,阿姆哈拉語約6000萬,斯瓦希里語超過1億,包括第二語言使用者。
- 自然語言處理領域前100種語言覆蓋了全球約96%的GDP,但僅覆蓋不到60%的世界人口,這解釋了為何商業關注並未跟隨說話人數。
- 非洲最重要的語言資源主要來自基層和學術研究,包括Masakhane、AI4D非洲語言計劃、Iro及AfroLID。
- 非洲有60%的人口在25歲以下,每年約有1200萬年輕人進入勞動力市場,形成一個龐大且多語言的勞動力群體。
- 肯尼亞2026年草案人工智能政策提出以國際標準為基準的公平薪酬評估,針對非洲地區報告的每小時1.46至3.74美元的收入,對比美國同等職位每小時21至27美元的薪酬。
- 區域中心的調整涉及五方面:招聘範圍、語言地理覆蓋、現場條件與部署匹配、數據本地化合規性,以及基於樞紐的響應時效。
- Lifewood在馬來西亞、印度尼西亞和美國站點擴展的同時,將非洲中心上線,並通過已發表的研究將語音AI覆蓋範圍拓展至低資源非洲語言。
資料與進一步閱讀
- Joshi等人,《自然語言處理世界中語言多樣性與包容性的現狀與命運》,見非洲語言實驗室論文中關於88%數據和2000多種語言的引用
- 《面向非洲低資源語言的自動語音識別:系統性文獻綜述》(arXiv,2025),涵蓋2020年至2025年7月的PRISMA綜述
- AI4D非洲語言計劃(arXiv,2021),關於全球96%的GDP與60%人口比例的數據
- NaijaNLP,《尼日利亞低資源語言調查》(arXiv,2025),關於IrokoBench和AfroLID的說明
- 普林斯頓CDH,《African_UD》,關於Masakhane的創立及非洲本土NLP工作的介紹
- Introl,《非洲人工智能數據中心熱潮》,關於人口結構和移動滲透率數據的說明
- ITWeb Africa,《肯尼亞為AI工作者設定標準》,關於草案公平薪酬框架的說明
- Lifewood,公司時間線與案例研究