跳轉到主要內容
AI 數據

與大學和社區合作開展語言數據工作

簡短回答。普諾克丘亞語語料庫分別與大學和當地社區組織合作,因為它們各自貢獻不同方面,如果合併就都會失去……

Mumu D. · 2026年7月2日 · 閱讀約 11 分鐘

簡短回答。 帕諾克丘查語語料庫與一所大學和一個本地社區組織 分別 合作,因為它們各有所長,合併它們會失去雙方的優勢。四階段參與式模型涵蓋規劃、準備、收集和部署四個階段,其中 治理在第二階段就已確定——在任何數據收集之前,而不是在數據收集之後。準備階段確立了CC0-1.0許可,為農業、醫療和科技領域準備了種子內容,並本地化了Mozilla Common Voice界面。收集階段採用志願者基於技能的貢獻,並由社區主導進行驗證。


語言數據的社區合作?

帕諾克丘查語語音語料庫提供了我所見過的此類合作最清晰的公開模板,值得首先注意到的細節是,該合作中有兩個夥伴,而非一個。

規劃階段涉及與阿爾蒂普蘭波諾國立大學及當地社區組織Illariy Ch'aska建立合作關係,同時確定ISO 639-3代碼並評估社區需求。

一所大學和一個社區組織,各自獨立運作,因為它們貢獻不同的資源。這種區別貫穿於本領域每一個成功的案例之中,而大多數商業項目都會因將大學部門視為社區獲取的代理而失敗。


四階段模型

普諾克丘查語團隊將他們的工作結構化為一個參與式設計過程,分為四個階段,值得逐一梳理,因為每個階段都包含容易推遲但代價高昂的決策。

規劃階段。精確界定語言,包括其ISO代碼。建立合作關係。評估社區需求。最後這一點是商業項目常常跳過的,而這正是合作與供應商關係之間的關鍵區別。

準備階段。建立數據治理機制,以他們採用的CC0-1.0許可為基礎。準備種子句子和問題,這些內容涵蓋農業、醫療和科技領域。並將數據收集平臺,以Mozilla Common Voice為例,本地化為普諾克丘查語。

請注意順序:治理機制在數據收集之前、在任何數據產生之前就已決定。若在數據收集之後才決定許可,則意味著需要與每一位貢獻者重新協商。

收集階段。以自願、基於技能的方式開展閱讀、說話、傾聽和寫作的貢獻,由社區主導進行驗證,並採用保護隱私的處理方式。

這兩點至關重要。基於技能的參與意味著人們以最適合自己的方式參與,從而擴大了參與範圍,超越了那些習慣於被錄音的人群。而驗證由社區主導而非外部機構,這既是質量決策,也是治理決策。

部署。在Mozilla數據協作體上開放發佈,配套貢獻證書和代金券激勵機制。

激勵模式值得暫停思考。證書和代金券而非僅現金,反映出在社區合作中,貢獻既是相互的,也是被認可的,而非純粹的交易行為。這並不否定支付人員的必要性,我已在本系列的其他部分對此有詳細論述。這只是一個觀察:在該特定模式中,認可本身具有獨立的價值。


為什麼大學和社區不可互換

兩者都能提供對方無法實現的資源,而墨西哥的Tonalli語料庫聯盟更清晰地體現了這種分工,因為它明確命名了各角色。

其合作伙伴包括一所具有深厚區域原住民語言與文化理解的跨文化教育大學,有助於深入參與原住民社區;一所技術類院校,提供技術與工程方面的專長,對數據採集與處理階段至關重要;INALI,致力於墨西哥原住民語言的保存與推廣,確保語言準確性與文化敏感性;以及INPI,其使命涵蓋原住民的權利與文化。

該聯盟還包括一個致力於加強墨西哥古代語言(尤其是納瓦特爾語)的音樂團體,通過歌曲作為促進語言保存的機制。

這一點是我會在範圍討論中特別關注的。一個音樂團體並非語料庫項目顯而易見的合作伙伴,它觸及了大學部門無法覆蓋的使用者、語境和語言使用方式。

大學通常帶來的優勢:方法論嚴謹性、倫理審查基礎設施、特定語系的語言專長、可培訓的學生群體、檔案保存能力以及項目週期之外的機構持續性。

哪些社區組織通常會帶來:獲取渠道、信任、對哪些品種重要以及對誰重要有認知、關於哪些內容應當記錄和發佈有判斷力,以及能夠依據實際生活經驗而非參考文獻來驗證內容的能力。

僅包含第一項的項目會產生方法上可靠但社區無參與權的數據;僅包含第二項的項目會產生文化上紮根的數據,但可能無法滿足技術規範。已發表的成功案例都兼具這兩點。


目前適用的治理框架

這一點已從良好實踐發展到更接近預期實踐,任何委託此類工作的人都應掌握相關術語。

在澳大利亞語言數據共同體的標準中,為實現長期可持續性,FAIR和CARE原則與PILARS並列提出。FAIR涵蓋可發現性、可訪問性、互操作性和可重用性。CARE涵蓋集體利益、控制權、責任和倫理,其存在是因為僅FAIR可能促進數據提取。

原住民數據主權是這一框架的基礎。GovLab在2026年的審查中明確指出:數據主權即自決權,社區希望在數據的收集、使用和共享方面擁有控制權。對於語言工作而言,一個關鍵的定義點是:數據不僅包括統計數據,還包括文化、語言、土地和關係。

在這些項目中,語言是數據本身,因此這些項目直接置身於主權討論之中,而非僅處於其邊緣。

同一份審查指出,原住民數據治理是‘實現互利研究夥伴關係的關鍵組成部分’,並描述了一個值得借鑑的過程:研究團隊在數月內開發了學術倫理資源和文件,隨後由原住民團體領導人進行審查,最終形成的材料被視為活文檔,可根據需要更新至其他項目中。

該綜述建議的未來工作重點是一個實用清單:社區和項目背景、數字環境的演變、個人與集體知識保護、計劃中的項目成果以及保密性和匿名性的細微差別。

個人與集體知識保護之間的區別是商業數據團隊最不熟悉的領域。標準的同意框架僅處理個人權利。一首歌、一個故事或一個儀式用語可能屬於一個社區,而非記錄它的個人,因此個人同意並不能解決這個問題。


讓合作持久

兩個例子展示了持久性的具體表現,且兩者都指向結構而非善意。

MILPA(墨西哥原住民語言推廣與倡導團體)是加州大學聖塔芭芭拉分校的教職員工、研究生和本科生與聖塔芭芭拉及文圖拉縣墨西哥原住民社區成員之間的合作項目,其中大多數社區團隊成員隸屬於非營利組織MICOP。這一合作自2015年起持續進行。

澳大利亞的CoEDL與AIATSIS從一開始就建立了合作關係,用於分析、記錄和歸檔。

兩個結構性特徵尤為突出:設立了明確的聯絡角色,即一名特定的研究助理負責合作關係,而非由所有人共同承擔;並且該合作是雙向進行的:它提升了研究項目對檔案資源的獲取能力,同時也支持社區團體將資料存入檔案館,為語言材料提供安全保管,同時使資源更易於被原住民社區獲取。

這種互惠性正是關鍵所在。材料單向流動的合作關係本質上是一種以友好名稱命名的提取安排。


現在正在構建什麼

有兩個發展值得關注,因為它們改變了進入該領域的人們的格局。

2026年宣佈的‘新公共領域原住民語言數據共同體孵化器’是一項為期六個月的能力提升計劃,旨在支持由原住民主導的團隊開發數據共同體:由社區治理的數據庫,實現負責任、公平的公共利益用途。該計劃與由19名全球原住民語言數據專家組成的指導委員會共同設計,並與GovLab和微軟合作實施,提供導師指導、技術指導和能力建設,概念提案將於2026年8月提交。

其重要性在於模式而非項目本身。由社區治理的數據集結構不同於開放發佈或商業授權,且這一模式正獲得重大支持並被制度化。

在一些司法管轄區,國家層面的語言數據共同體基礎設施正在建設中。澳大利亞的項目提供了尊重文化協議的數據治理框架,支持保護脆弱或瀕危語言材料,幫助以適當方式使材料可獲取,並提供工具和培訓,以支持社區主導的語言數據使用。

對於商業數據運營而言,這兩個發展都指向同一個方向:基礎設施和規範正由社區和學術機構設定,明智的商業立場是融入其中,而非繞開它們。


我們所處的位置

利益聲明:Lifewood在50多種語言和方言中收集語言數據,基於合作的方式是實現低資源語言工作開展的途徑。

我有三點觀察想分享給任何正在構建此類結構的人。

夥伴關係的建立時間遠長於項目執行週期。MILPA的合作關係已有十一週年。CoEDL與AIATSIS從一個多學年的中心項目啟動之初就建立了合作關係。一個商業時間表將‘建立社區夥伴關係’分配為三週,誤解了其中的時間單位。實際意義是,應在需求出現之前就建立關係,而不是在簽署合同之後才開始建立關係。

指定一名聯絡人。CoEDL將由特定人員負責機構間關係的模式值得完全複製。如果關係是每個人的責任,那麼實際上就沒人負責,且這些關係會在項目之間悄然衰減。

在數據收集之前就確定治理結構,並誠實地說明商業立場。一個社區在決定是否與商業數據公司合作時,有權瞭解數據的去向、誰可以授權使用、是否為獨家授權、以及社區自身保留了什麼權利。這些問題都是必須回答的,而答案可能比學術開放發佈模式更保守。明確說出這些內容,比在數據收集之後才發現不匹配要好。在我的經驗中,社區對一個清晰的商業方案的接受度,遠高於對模糊方案的接受度。


夥伴關係檢查清單

分別與大學和社區組織接觸,並在接觸前明確各自能提供的貢獻內容。

在規劃階段,精確界定語言,包括ISO代碼和目標方言。

評估社區需求,並做好準備,以應對需求可能改變項目範圍的情況。

在數據收集前,決定許可協議與治理機制。

將數據收集平臺本地化為目標語言,而非使用通用語言運行。

提供基於技能的參與方式,涵蓋閱讀、說話、傾聽和寫作,讓人們以最適合自己的方式貢獻。

在內容具有文化屬性的情況下,由社區主導驗證過程。

同時考慮集體與個人的知識權利,因為單個發言者的同意並不能確立其言論的社區所有權。

在結構中建立互惠關係,使資源與能力雙向流動。

指定聯絡人,併為項目間的關係提供持續資金支持,不僅在項目期間。

在協議中明確引用FAIR、CARE和原住民數據主權框架,因為這些框架如今已成為行業預期的術語。


關鍵要點

  • 普諾克丘亞語語料庫與一所大學和一個本地社區組織建立了合作關係,雙方分別參與,因為它們各自貢獻不同的資源。
  • 四階段參與式模型涵蓋規劃、準備、數據收集和部署四個階段,在任何數據存在之前,治理結構已在第二階段確定。
  • 準備階段包括設定CC0-1.0許可協議,為農業、醫療和科技領域準備種子內容,並將Mozilla Common Voice平臺本地化至該語言。
  • 數據收集階段採用志願者基於技能的貢獻,涵蓋閱讀、說話、聆聽和寫作,且由社區主導進行驗證。
  • 部署階段採用開放發佈方式,配以貢獻證書和代金券激勵,既認可了貢獻,也對貢獻進行了補償。
  • 墨西哥的Tonalli語料庫聯盟為合作伙伴設立了明確的角色分工:文化交融教育領域的專業知識、技術與工程能力、國家級語言機構在語言準確性與權利方面的支持,以及一個通過歌曲觸達使用者的音樂團體。
  • 大學通常貢獻方法論嚴謹性、倫理基礎設施、語言專業知識、可培訓的學生資源以及機構的持續性;社區組織則貢獻訪問渠道、信任建立、多樣性的知識、適用性判斷以及基於真實生活經驗的驗證。
  • FAIR和CARE原則,以及PILARS,被列為國家級語言數據共享基礎設施長期可持續發展的標準。
  • 原住民數據主權將數據視為自決權,社區尋求對數據的收集、使用和共享擁有權威,將數據定義為包括文化、語言、土地和關係,而不僅僅是統計數據。
  • 建議的重點領域包括社區和項目背景、數字環境的演變、個人與集體知識的保護、計劃產出以及保密性的細微差別。
  • 個人同意並不能解決集體知識權利,這一點是商業同意框架處理得最差的地方。
  • MILPA自2015年以來一直由加州大學聖塔芭芭拉分校與墨西哥原住民社區組織之間開展。
  • CoEDL和AIATSIS從一開始就建立了明確的聯絡角色,並實現了雙向互惠,既提升了研究的可及性,也幫助社區團體存檔和保護其材料。
  • 新公共領域原住民語言數據共享孵化器,由一個由19名成員組成的全球指導委員會共同設計,並由GovLab和微軟實施,支持由原住民主導的團隊構建由社區治理的數據集。
  • 夥伴關係的建立比項目運行週期更長,因此應提前建立關係,而不是在合同需求出現時才建立關係。

資料與進一步閱讀

常見問題

因為它們各自貢獻不同方面。

在數據收集之前。普諾克丘亞語項目在準備階段就設立了CC0-1.0授權,此時還沒有任何數據存在。如果事後決定,則意味著需要與所有貢獻者重新協商。

FAIR涵蓋可發現性、可訪問性、互操作性和可重用性。CARE涵蓋集體利益、控制權、責任和倫理,因為僅靠FAIR原則可能促進數據的提取。

個體同意僅涵蓋個人自身的貢獻。一首歌曲、一個故事或一個儀式用語可能屬於一個社區而非記錄它的個人,個體同意並不能解決這個問題。

比一個項目要長。MILPA 項目自2015年啟動以來一直運行,CoEDL 從一個多年度中心啟動之初就與 AIATSIS 建立了合作關係。關係應在需求出現之前建立,而不是在簽署合同之後建立。

可以,但前提是必須明確說明商業立場。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊