簡短回答。 "我們覆蓋斯瓦希里語" 並非覆蓋聲明。 AfriVoices-KE 對基庫尤語進行了五個方言的範圍界定——基ambu、Murang'a、Nyeri 和 Kirinyaga,其中 Kirinyaga 進一步細分——以及對卡倫金語進行了兩個群體的界定,即 Nandi 和 Kipsigis,合計覆蓋了估計 60 到 70% 的使用者。這是一個有據可查且明確界定的聲明,而非一個語言名稱。方言與口音是兩種不同的概念:方言變異體現在詞彙、語音、語調和形態句法層面,而地域口音主要體現在語音層面,由地理或 ISO 代碼衍生的標籤則混淆了這兩者。
區域級別?
一位客戶要求獲取基庫尤語的語音數據。基庫尤語大約有815萬使用者,擁有ISO代碼和維基百科頁面。這看起來像是一個採購項目。
AfriVoices-KE團隊在收集此類數據時,採用了涵蓋基姆布烏、穆蘭加、內裡和基里尼亞加的五方言框架,其中基里尼亞加進一步細分為Kĩ-Ndia和Gĩ-Gĩchũgũ,以捕捉區域語音和社會語言學差異。
五個方言,來自一份範圍文檔中的一個條目。
而對於卡倫金語,一個在裂谷地區擁有約630萬使用者的南尼洛特語族,該團隊做出了相反的決定。他們聚焦於使用最廣泛的兩個群體——南迪和基皮西吉斯,這兩個群體加起來約佔所有卡倫金語使用者的60%至70%。
這就是覆蓋範圍規劃做得很好的例子:一個明確的決策,有明確的說明,並記錄了覆蓋到的使用者人口百分比。大多數項目都是隱式地做出這一決策,即在最容易招募的地方進行招募,卻從未將最終結果寫下來。
決定一切下游工作的區別
在進行覆蓋範圍規劃之前,你需要一個分類體系,而文獻中存在一個區別,大多數採購對話都忽略了這一點。
方言差異涉及詞彙選擇、語音、語調和形態句法方面的不同。不同的詞語,不同的語法。
地域口音更應被理解為在共享方言詞彙和語法基礎上的語音差異。相同的詞語,以不同的方式發音。
為什麼這很重要,研究人員本人曾如此指出:基於地理或ISO代碼的標籤會將詞彙和語法差異與發音差異混淆,從而影響數據合併決策以及模型錯誤的解讀。
請反覆閱讀一遍,因為它解釋了一類項目失敗的範疇。如果您的數據集因為發音不同而將兩種變體標記為獨立,而它們實際上共享相同的詞彙體系,那麼您就錯誤地將本應合併的數據分開了;如果數據集因為地域相同而將兩種變體標記為相同,而它們在語法上卻存在差異,那麼您就錯誤地將本應分開的數據合併了。無論哪種情況,當模型表現不佳時,您都無法判斷問題出在語音層面還是語言層面。
一個有用的第三個維度與上述維度並列存在。語音語料庫也因語體不同而存在差異,即語言受活動或場景的制約,也因情感表達不同而存在差異,即通過言語表達情感。一個數據集可能具備良好的地理覆蓋,卻僅涵蓋一種語體,從而導致模型能夠處理所有地區下的正式語言,卻無法處理任何場景下的日常對話語言。
為什麼ISO代碼並非覆蓋方案
已發表語料庫中的標籤問題已有充分文獻記載,這使得現有數據的再利用比表面看起來更困難。
不同數據集中的方言標籤分別由政治地理邊界、粗略的區域分組或ISO風格代碼(如apc或ary)定義。研究人員指出,這種差異會阻礙對低資源方言數據進行原則性合併與選擇。
為阿拉伯語語音技術記錄的反覆出現的瓶頸問題具有廣泛適用性:開放獲取標準的不足、對少數語言變體覆蓋不均、子方言標註不一致,以及數據質量與採集條件的文檔記錄不足。
還有一個發現與最大化數據量的直覺相反:合併並不總是有益的:阿拉伯語連續體中不同方言之間的相互可懂性差異,可能使無差別混合的效果不如有針對性的跨方言遷移有效。
來自相鄰變體的更多數據可能會使目標變體的模型表現更差。這意味著覆蓋範圍的界定並非‘在預算允許的範圍內收集儘可能多的變體’,而是‘決定哪些變體屬於同一類,哪些不屬於’。
方言連續體問題
最難界定的情況是連續體,而這種情況比離散方言模型所暗示的更為普遍。
在方言連續體中,相鄰的定居點使用非常相似且相互可懂的方言,而更遠距離的同一體系定居點則使用相互不可懂的方言。文獻中給出的例子包括西羅曼語、東斯拉夫語和北歐語系連續體,高加索地區被特別指出是一個複雜案例。
不存在天然的邊界可以劃分。你所畫出的‘變體A’與‘變體B’之間的任何界限,都是你做出的決策,而非你發現的事實。
方法論上的後果被明確指出:為了反映地理區域內的語言變異,必須從大量不同地點收集數據。而歷史上的失敗模式同樣明顯,因為大多數研究傳統上都假定分佈是均勻的。
對於一個數據項目而言,這意味著抽樣框架是地點,而不是語言。在一條連續的地理範圍內設置三個記錄點,將產生一個代表三個點的數據集,且不會進行任何插值。
覆蓋範圍是如何實際被映射的
四種方法,具有不同的成本和不同的可靠性。
傳統方言調查。通過地區系統性地提取特定變量。權威性強但極其緩慢:在一百年來的研究中,英國和美國僅完成過少數全面的調查。
基於應用程序的大規模數據收集。最近最令人印象深刻的一個例子,通過一款手機應用程序,從英國超過4,900個地點的47,000多名講者中收集了關於26個變體的數據。這種規模是傳統調查方法無法達到的。
基於語料庫的映射。從大規模地理定位文本語料庫中推導出語言變異。關鍵問題是其是否具有普適性,目前已有證據表明它確實具備這種能力:一項將基於18億詞地理定位英國推特語料庫構建的139個詞彙方言地圖與BBC Voices方言調查進行對比的研究發現,兩者之間存在廣泛的吻合。這種驗證使得基於語料庫的映射方法可用於一般性區域變異研究,這一點至關重要,因為其成本比調查工作低幾個數量級。
現有參考文獻。如Ethnologue及類似參考文獻提供了方言清單和講者估算數據。
AfriVoices-KE引用了這些資料用於其方言框架和講者數量的設定。它們僅作為起點而非全面規劃,因為不同來源的清單存在差異,講者數量均為估算值。
商業項目中通常採用一種組合方法:參考文獻用於列舉候選變體,語料庫或應用數據用於驗證哪些差異實際上存在,而本地專業知識則用於判斷哪些內容適合部署。
覆蓋決策具有時間維度
有兩個方言學過程值得了解,因為它們說明覆蓋地圖具有有效期。
地理擴散是指一種語言特徵通過不同方言使用者之間的面對面接觸,逐漸從一個地區傳播到另一個地區的過程。
方言趨同是指地方方言之間的差異逐漸消失,通常趨向於一種標準方言。
一項英國研究將最新的調查數據與1950年代的數據進行對比,發現一些方言特徵在六十年間發生了變化,而另一些則保持不變。這一點很有意義:變異並不會簡單消失,而是會移動,且這種移動是不均勻的。
對於數據項目而言,這意味著基於二十年前出版的參考文獻構建的覆蓋框架,可能描述了已經趨同的差異,也可能遺漏了新出現的差異。同一地區中的老年和年輕使用者可能需要分別處理。
已記錄的覆蓋範圍看起來是什麼樣子
將這些實踐綜合起來,收集開始前應在紙上明確以下內容。
列出候選方言的枚舉清單,並明確該清單的來源。
明確選定的方言及其理由。以AfriVoices-KE Kalenjin的決策為例:選擇了兩種方言,其覆蓋講者比例的估算為60%至70%。
每種方言的講者人口估算,並註明來源,以便驗證覆蓋聲明的準確性。
應明確指定採樣地點而非僅列出方言,尤其在連續性語言現象中更為重要。
明確的合併規則。哪些方言在數據集中將被視為一個標籤,哪些不會,應基於語言學依據而非行政便利性來決定。
在元數據模式中區分方言和口音標籤,以便下游用戶能夠適當地進行合併或拆分。
不僅涵蓋地理分佈,還應涵蓋語體和說話者因素的覆蓋情況。
一項關於範圍之外內容的說明,即被省略的部分,這部分是客戶最需要的內容。
可以從Voxlect基準測試中借鑑一個技術細節:在構建方言分類數據時,他們排除了時長少於三秒的音頻片段,認為其不足以支撐穩健的方言分類;同時,他們也剔除了僅標註為‘British’的樣本,因為缺乏對蘇格蘭等具體地域變體的明確界定。這兩項都是質量決策,只有在明確目標粒度的前提下才具有意義,這也再次說明了必須先確定框架的重要性。
我們的工作所處的位置
明確利益相關:Lifewood的語言能力被表述為涵蓋50多種語言和方言,其中第二個詞承載了絕大部分實際操作意義。
從這項工作中得出的兩個觀察結果。
第一個觀察是,方言框架必須由當地居民構建,而不是從首都城市的一份參考文獻中選擇。參考目錄僅是起點,通常比說話者實際做出的區分更粗略,有時又過於細緻,保留了一些已經消退的區分。能夠告訴你哪些是哪些的人,正是那些生活在當地的人,這首先是一個招聘問題,而非語言學問題。
第二個觀察是,覆蓋範圍的界定是多語言項目最容易悄悄出錯的地方,因為它發生得早,看起來只是行政事務,通常由撰寫工作說明書的人最終決定。一個項目若規定了‘Kikuyu’並招募到內羅畢,最終交付的成果將是一種由遷移到城市的人群所使用的特定方言,而這一方言會被整體標註為‘Kikuyu’語言。交付數據中不會反映出這一點。問題會在後期顯現:模型在某個區表現良好,而在其他四個區表現糟糕。
解決方法並不華麗:必須明確地決定框架,招聘時應以具體地點為依據而非語言名稱,且報告覆蓋範圍時應按方言種類分別列出,而非彙總為整體數據。
關鍵要點
- AfriVoices-KE 採用了涵蓋基庫尤語五個方言的框架,包括基ambu、Murang'a、Nyeri 和 Kirinyaga,其中 Kirinyaga 被細分為 Kĩ-Ndia 和 Gĩ-Gĩchũgũ。
- 對於卡倫金語,同一團隊覆蓋了兩個群體,即 Nandi 和 Kipsigis,其使用者約佔估計的60至70%。這是一個有據可查、可辯護的範圍決策。
- 方言差異涉及詞彙、語音、語調和形態句法方面的差異。地域口音主要是在共享詞彙和語法基礎上的語音差異。
- 基於地理或ISO代碼的標籤將二者混為一談,影響了數據集的合併決策,並使模型錯誤更難解釋。
- 語體和情感是額外的維度:一個數據集可以具有完整的地理覆蓋,卻僅包含一種語體。
- 已發表語料庫中的方言標籤,分別由政治地理邊界、粗略的區域分組或ISO代碼定義,這阻礙了對低資源方言進行原則性合併。
- 已記錄的瓶頸包括標準化程度有限、覆蓋不均衡、子方言標註不一致以及對數據收集條件的記錄不足。
- 合併並不總是有益的:互 intelligibility 的差異可能使無差別混合的效果不如有針對性的跨方言遷移有效。
- 在方言連續體中,相鄰的聚居地之間可以相互理解,而遙遠的聚居地則不能,因此任何邊界都是一種決策而非發現。抽樣框架應基於地點而非語言。
- 傳統的方言調查具有權威性但進展緩慢,在過去一百年中,英國和美國僅完成了少數幾項調查。
- 基於應用程序的收集在英國超過4900個地區覆蓋了超過47,000名說話者,共進行了26次交替採集。
- 基於語料庫的映射具有泛化能力:從一個包含18億詞的地理定位推特語料庫中提取的139個詞彙地圖,顯示出與BBC Voices調查的廣泛一致性。
- 地理擴散通過接觸傳播特徵,而方言趨同則削弱了地方差異,趨向於標準語言,因此覆蓋框架具有時效性。
- 一個明確的範圍需要列舉多樣性並附上來源,明確的選取標準及其理由,說話者份額,抽樣地點,明確的合併規則,方言與口音的元數據,語體覆蓋情況,以及明確說明哪些內容超出範圍。
- Voxlect排除了時長少於三秒的片段,認為其不足以用於方言分類,並剔除了僅標註為‘英國’的樣本,因其缺乏地域特異性。
資料與進一步閱讀
- "AfriVoices-KE: 一種用於肯尼亞語言的多語言語音數據集",arXiv,基於五方言的基庫尤框架,涵蓋60%至70%說話者的兩組分類的卡倫金語選擇,以及說話人群數量數據
- "阿拉伯聲音:繪製標準阿拉伯語與方言阿拉伯語語音技術地圖", arXiv, 關於方言與地域口音的區別、ISO及地緣政治標籤問題、語體與情感軸線,以及合併策略並非普遍有益的發現
- "通過地理採樣檢測語言變異", 《語言地理學雜誌》,關於方言連續體、遠距離間的相互理解性以及需要在眾多地點進行採樣的必要性
- "利用推特映射英國英語的詞彙方言變異", Frontiers in Artificial Intelligence, 在與BBC Voices的139張地圖對比中,Leemann等人應用研究覆蓋了47,000名說話者分佈在4,900個地點,以及全面傳統調查資料的匱乏
- "Voxlect:一個用於建模全球方言與地方語言的語音基礎模型基準", arXiv,關於方言分類所需的最小片段時長以及排除不夠具體的標籤
- 約克英語語言工具包,"繪製方言地圖",關於地理擴散、方言趨同以及長達六十年的英國比較研究發現各變量變化混合
- Lifewood,多語言及方言數據採集