簡短回答。 就業平臺和眾包平臺無法覆蓋大多數非洲語言的使用者,因此招聘工作通過人際關係進行——即通過研究社區、大學和已有的語言網絡來實現。 Masakhane 自2018年成立以來,已開發出400多個語言模型和超過20個數據集,並培訓了100多名非洲數據科學家,成為進入這些社區最有效的方式。已有實踐表明,這種做法並不華麗:連續三次每週會議中向一個活躍社區徵求建議。 Nekoto等(2020年) 證明了社區在無需正式培訓的情況下,也能對自然語言處理產生實質性貢獻。
非洲語言數據情況如何?
在國際自由職業平臺上發佈一份需要Fongbe語言使用者參與的職位廣告,你將收到極少的申請,其中大多數都不合適。並非因為Fongbe語言的使用者不存在,大約有兩百萬人使用該語言,而是因為渠道錯誤。幾乎沒有任何以Fongbe為母語的人會瀏覽國際自由職業平臺尋找標註工作。
這是非洲語言數據項目中的招聘問題,其對項目成功的影響遠超幾乎所有下游環節。如果一個設計良好的數據收集協議無法在可用的貢獻者群體中執行,那麼最終將一無所獲。
好消息是,有效的路徑已被充分記錄,其中一項研究發現尤其應改變團隊對誰符合資格的看法。
拓寬貢獻者群體的研究發現
在數據操作中,默認假設是,貢獻者在能夠產生可用輸出之前需要接受培訓。對於大多數標註任務,這一假設是正確的。
然而,在參與式語言數據收集方面,證據指向相反的方向。Nekoto及其同事2020年的研究表明,低資源環境中的社區即使沒有正式培訓,也能顯著貢獻於自然語言處理領域。
這一單一發現使得社區招募成為可能。它意味著資格標準是母語熟練程度和承諾,而非先前的技術經驗,這將可服務的群體規模擴大了數量級,並將責任從候選人篩選轉移到指南質量與支持上。
這並不意味著培訓是不必要的。這意味著培訓是關於任務本身,而非語言,而且可以面向從未參與過數據工作的人員進行交付。
貢獻者實際的來源
有效的渠道是特定的,且大多不是商業性質的。
研究與實踐社區。Masakhane是非洲語言領域的核心組織:一個成立於2018年的泛非洲開源倡議,已開發出超過400個語言模型和20多個數據集,涵蓋盧加爾達語、約魯巴語、isiZulu和阿姆哈拉語等語言,並已培訓了超過100名非洲數據科學家。
實踐文獻明確將Masakhane與大學郵件列表以及組織的Slack或Discord頻道並列為文化契合型數據工作的招募渠道。
實際操作的機制值得了解,因為它們並不華麗。在一項已記錄的研究中,研究人員通過在為期三週的每週常規會議上向Masakhane社區徵求建議,並通過該社區的Slack群組進行招募,而非開展宣傳活動。這是一種持續存在的關係,被反覆使用。
學術網絡。相關國家的大學語言學和計算機科學系,能夠接觸到已經熟悉結構化數據工作的語料使用者。深學習Indaba及其區域IndabaX活動,構成了這一網絡在大陸範圍內的匯聚點。
社區組織和語言協會。對於沒有強大大學支持的語言,文化協會、廣播電臺以及教會或民間團體往往是獲取特定方言使用者的唯一途徑。
結構化項目。在拉丁美洲,一種類似的模式曾利用結構化的社會服務項目,調動學生志願者參與轉錄和分段工作,共產生了八個開放獲取的語言資源。
類似的結構在非洲多個國家存在,但目前被商業數據項目嚴重忽視。
眾包平臺對廣泛使用語言有效,對其他語言則完全無效。Mechanical Turk和Prolific為斯瓦希里語提供了可用的參與者池,但對於豐貝語或法恩特語則幾乎沒有任何可用資源。
社區主導模式目前正在實現規模化運作
值得了解,因為它為雄心設定了基準,並改變了競爭格局。
馬薩克納非洲語言中心正在收集50種語言的高質量多模態數據,目標是為每種語言收集500小時的語音數據,用於語音到語音翻譯。如果完全實現,總計將達到25,000小時,而目前已有出版語料庫的語言數據僅達到數十小時。
該項目的資金支持非常雄厚。LINGUA Africa聯合了比爾及梅琳達·蓋茨基金會、谷歌公益基金會以及微軟AI為善實驗室,與馬薩克納合作,為語言人工智能項目提供資金和雲計算支持。
該模型正進一步下沉到地方層面。在2026年拉各斯舉行的深度學習大會(Deep Learning Indaba)上,以‘主權智能’為主題,馬薩克納宣佈了社區試點資助計劃,建立從大會直接通往IndabaX社區的通道,以構建服務於非洲人民的數據集。
該研討會所採用的表述是我在這項研究中找到的最有用的一句話,它應當重塑數據收集項目的規劃方式。該會議主題為《超越網絡:你的語言在哪裡?》,開篇即指出數據短缺問題以及線下資源中蘊含的巨大財富。
其論點是,儘管網絡爬取的非洲語言數據稀缺、法律受限且文化語境缺失,但整個非洲大陸的檔案館、廣播錄音、口述歷史和實體收藏中,蘊藏著大量尚未被開發的數據資源。在這一框架下,招募工作不僅意味著找到願意對著麥克風說話的人,更意味著找到那些掌握並能夠提供訪問權限的人,以獲取已存在的材料。
為什麼‘可用數據’通常並非‘可用數據’
兩個已記錄的案例說明了為何僅依賴已發表的數據無法規避招募工作。
領域偏差。許多非洲語言基礎模型的訓練數據來自JW300,這是一個從宗教出版物中衍生出的大型平行語料庫。該語料庫確實非常有用,但其內容嚴重偏向宗教主題,這一點在啟動AI4D非洲語言項目時已被明確指出。基於該語料庫訓練的模型在處理宗教文本方面表現良好,但在處理日常對話或技術性文本時則表現不佳。
正字法不一致。Fongbe語言使用聲調符號,如è、é和ê。一些語料庫保留完整的符號,而另一些則完全去除這些符號,當數據集被合併時就會產生兼容性問題。非標準正字法和數字資源的匱乏是非洲語言資源調查中反覆出現的障礙。
此外,還存在一個文檔缺口,影響著所有希望基於現有資源進行開發的人。2026年的一項調查顯示,Masakhane專注於機器翻譯,導致資源選擇所需的關鍵元數據經常缺失:數據集的詞數或句子數量、許可條款、文件格式、領域覆蓋範圍以及預處理要求。
實際後果是,一個項目在初期假設可以從現有資源中整合語料庫,但幾週後通常會發現這些資源是宗教性質的、無聲調符號的、商業使用許可受限的,或全部都是這樣。
設計一個有效的招聘流程
有六項因素決定了候選池是否能夠被填滿。
招聘應側重於語言的多樣性,而非語言本身。Twi語言並非單一形態,來自庫馬西和來自阿克拉的貢獻者可能在某些方面存在差異,這對數據集至關重要。明確指定目標語言變體,並據此進行明確的招募,因為泛泛地呼籲‘Twi語言使用者’會過度招募網絡最強大的那個變體。
應考察實際語言能力,而非資質。鑑於Nekoto研究結果,要求先前的標註經驗會過濾掉絕大多數潛在候選人,而毫無質量提升。應通過一個簡短的、以目標語言為基礎的實際任務來評估其語言能力。
應通過人,而非平臺。所有已記錄的成功案例都經過現有關係的傳遞:一個社區、一個部門或一個協會。在項目啟動前,務必預留時間來建立這些關係,因為它們無法在兩週內創建。
明確說明目的。在參與式項目中,參與者始終會回應‘這項工作服務於他們的語言使用者’這一論點。這不是營銷話術,而是實際的價值主張,其吸引力遠超單純的薪酬水平。
在適當情況下提供認可。一項已有研究曾向參與者提供作者身份。這種模式並非適用於所有商業項目,但其核心觀點依然成立:人們希望為語言資源的貢獻獲得認可,而這種認可與薪酬一樣,具有真實的招募價值。
合理支付並提前說明。我此前在本系列文章中提到,肯尼亞2026年擬議的人工智能政策草案提出,應以國際標準對標註和評估崗位實行公平薪酬基準。在勞動力條件爭議持續存在且監管關注日益增加的市場中,薪酬條款是招聘策略的一部分,而非後臺操作的細節。
留存是更難解決的問題
招聘獲得關注,留存決定項目是否真正落地。
對於語言使用者群體較小的語種,經過培訓的貢獻者並非可替代的單位。如果一個項目中有十人掌握目標方言併產出經驗證的成果,失去三人意味著能力下降30%,且需要數月時間才能重建,因為當初發現他們的招聘渠道本質上是基於人際關係,而非簡單的排隊機制。
有三項措施能具體降低該情境下的流失率。
可預期的工作。零散參與會讓人轉向其他事務。一名九個月前曾參與為期兩週工作的貢獻者,當你再次聯繫時,實際上已變成一名新招募的人員。
發展進程。那些從貢獻者成長為評審員,再成為負責人並持續留任的人員,也解決了驗證團隊的人力配置問題,因為第二層評審需要的正是數據採集層已經培訓過的人員。
反饋。向貢獻者說明其數據的用途以及模型如何因此得到改進,在參與式工作中具有異常的激勵作用,且成本為零。
我們在這一框架中的位置
表達興趣:Lifewood 在其最近的擴張中,將交付中心拓展至非洲,而低資源語言項目的人才招募,正是這些中心的重要工作內容之一。
我認為無論由誰來運營這項工作,以下兩點觀察都成立。
第一點是,招募工作無法集中化。吉隆坡的團隊無法在達喀爾招募沃洛夫語使用者,並非因為能力不足,而是因為渠道是本地的、非正式的、基於人際關係的。瞭解哪些大學院系教授相關語言學、哪些社區廣播電臺覆蓋到目標人群、哪些協會匯聚了特定方言的使用者,這種知識僅存在於實地之中。
第二點是,社區模式與商業模式是互補而非競爭的關係。
Masakhane 以及類似項目正在以商業機構無法複製的規模和合法性構建開放資源,因此明智的商業策略是建立在這一基礎之上,而非圍繞它展開:從這些網絡中招聘人員,尊重其許可協議,儘可能回饋貢獻,承接那些社區志願者無法承諾的、以客戶需求為導向、有明確截止日期和合同範圍的數據採集工作。
規劃階段需要考慮的內容
在項目啟動前,預留預算用於建立網絡關係。對於沒有現有語料庫的語言,通常需要提前三到六週進行網絡建設,然後再開啟招募工作。
應明確目標方言,而不僅僅是語言本身。
實際篩選,而非僅看資質,且應預期具備能力的貢獻者,即使他們沒有數據處理經驗。
在正式委託之前,先檢查已有資源,並重點核查其領域偏差、重音符號處理和許可情況,而非默認認為已發表語料庫是可用的。
詢問是否存在離線材料。檔案、廣播錄音和口述歷史收藏可能比任何節目製作都能提供更可用的音頻內容,招募任務實際上變成了尋找這些材料的保管者。
與招募一樣,應有意識地規劃數據保留工作,包括可預測的工作安排、職業發展路徑和反饋機制。
薪酬應參照國際標準設定,並在招募材料中明確說明相關條款。
關鍵要點
- 招聘網站和眾包平臺無法覆蓋大多數非洲語言的使用者。招聘依賴於人際關係:研究社區、大學網絡、社區組織和結構化項目。
- Nekoto等人(2020)證明,在資源匱乏環境中,社區即使沒有正式培訓,也能顯著貢獻於自然語言處理,因此原生語言能力而非以往經驗成為資格標準。
- 自2、2018年成立的Masakhane已開發出400多個語言模型,超過20個數據集,並培訓了100多名非洲數據科學家,文獻中將其列為與大學郵件列表和組織Slack頻道並列的主要招聘渠道。
- 記錄的招聘實踐並不華麗:在連續三次每週會議上向一個常駐社區徵求建議,並通過Slack進行溝通。
- Masakhane非洲語言中心正在為50種語言收集多模態數據,每種語言目標收集500小時的語音數據,用於語音到語音翻譯。
- LINGUA Africa將比爾及梅琳達·蓋茨基金會、Google.org和微軟AI為善實驗室與Masakhane聯合起來,共同為語言AI項目提供資金和計算資源。
- 在拉各斯舉行的Deep Learning Indaba 2026上宣佈的社區試點資助項目,為從Indaba到IndabaX社區的本地數據集構建建立了通道。
- 研討會主題"超越網絡:你的語言在哪裡?"指出了尚未被利用的檔案、廣播錄音、口述歷史和實體收藏庫,使招聘部分地轉化為尋找現有材料的保管者。
- 可用數據往往不可用:JW300數據集嚴重偏向宗教內容,這促使了AI4D非洲語言項目的發展。
- 豐博語的聲調符號在部分語料庫中被保留,在其他語料庫中則被移除,當數據集合並時會產生兼容性問題。
- 現有的非洲語言資源通常缺乏關於數據集規模、許可條款、文件格式、領域覆蓋範圍和預處理要求的元數據。
- 應針對具體方言而非語言進行招聘,實際能力而非資質進行篩選,通過現有關係渠道引入,明確說明目的,提供認可,並提前說明薪酬條款。
- 在標註工作中,留存比一般標註工作更為重要,因為合格人員數量較少,失去三位貢獻者可能導致容量下降30%,且需要數月時間重建。
- 可預測的工作內容、逐步晉升至審核崗位以及瞭解數據使用情況的反饋,是三大最有效的留存手段。
資料與進一步閱讀
- "非洲人工智能鴻溝的圖譜:基礎設施、可及性與能力",arXiv,AI4D非洲語言項目成立時,400多個模型,20多個數據集,100多名訓練數據科學家,非洲語言樞紐50種語言500小時目標以及LINGUA非洲基金支持
- 2026年深度學習印度納大會,"培育非洲主權自然語言處理" 工作坊議程,關於社區試點資助、數據饑荒框架以及離線資源中的隱藏財富
- "Kaleidoscope:用於大規模多語言視覺評估的同語言考試",arXiv,基於Nekoto等人(2020)的研究,以及無需正式培訓的人工參與貢獻,以及MaRVL的母語者貢獻模型
- "文化敏感且適應性的自然語言處理:一種分類體系與現狀綜述",arXiv,通過Masakhane、大學郵件列表以及組織的Slack或Discord渠道進行招募
- "利益相關者諮詢參與非洲語言技術路線圖",PMC,關於通過每週會議和Slack實現的實際招聘機制以及作者貢獻提議
- "AI4D非洲語言項目",arXiv,基於JW300宗教內容偏見,作為推動新數據收集的動機
- "哈薩語和豐貝語的文本與語音資源綜述",arXiv,關於豐貝語的調值符號不一致、非標準正字法障礙以及資源元數據缺失問題
- Lifewood,非洲交付中心和多語言數據採集