跳轉到主要內容
AI 數據

右向左及複雜書寫的文本數據收集

簡短回答。在拉丁文文檔上達到97%準確率的管道,在阿拉伯語或希伯來語上通常會下降到85–90%。阿拉伯語自然語言處理研究人員將右向左排版描述為……

Mumu D. · 2026年7月6日 · 閱讀約 10 分鐘

簡短回答。 針對拉丁文文檔的管道通常能達到 97% 準確率,但在阿拉伯語或希伯來語上會下降到 85–90%。阿拉伯語 NLP 研究人員將從右到左的排版描述為實際上已解決,但尚未普遍實施——失敗點在管道中,而非理論層面。三大文字體系構成了大部分困難:從右到左且具有上下文形狀、無空格的表意文字系統,以及帶有複雜連寫結構的印度文字系統。阿拉伯字符根據位置分為孤立、初寫、中寫和末寫形式,這增加了識別器需要區分的視覺類別數量。


如何為從右到左和複雜腳本收集文本數據?

從糾正開始,因為關於這個主題的大多數寫作都錯誤地強調了重點。

一篇關於阿拉伯語自然語言處理的全景式調研,在一句話中提到了從右到左的排版,然後就將其擱置了:作者沒有包括從右到左阿拉伯語排版的問題,他們將其描述為一個基本解決的問題,儘管並未普遍實現。

這個附註很重要,主句也同樣重要。從右到左文本的渲染在標準層面已經解決。你的處理流程仍可能在該問題上出錯,因為實現程度不一,但這屬於工程缺陷,而非研究問題。

真正決定阿拉伯語、希伯來語、烏爾都語、天城文或阿姆扎吉語文本收集項目成敗的困難,存在於其他方面:正字法變化、變音符號、形態豐富性以及腳本異質性。

本文正是圍繞這些內容展開的。


三種腳本家族及其各自的問題

文檔處理文獻指出了三種主要驅動架構複雜性的腳本家族,每種家族的失敗模式各不相同。

從右到左並結合上下文形態變化。適用於阿拉伯語和希伯來語。一個在拉丁字母文檔上達到97%準確率的流程,在處理阿拉伯語或希伯來語時會下降到85%至90%,因為從右到左的書寫方向和字符的上下文形態變化需要完全不同的分段邏輯。

上下文形態變化的要點是最容易被低估的。阿拉伯字符根據其在單詞中的位置會呈現不同的形態:孤立、初始、中位和末尾。這使得識別系統必須區分的視覺類別數量成倍增加。拉丁字母有大寫和小寫,但這些變化較為有限,並不完全依賴於字符位置。加上連筆和合字,分段問題變得真正困難。

表意文字系統,包括中文、日文和韓文。其字形數量達到數萬,標準 CJK 統一表意文字超過 20,000 個,繁體中文字形超過 50,000 個;關鍵在於,詞元之間沒有空格分隔。這會產生累積效應:一次分詞錯誤可能使其後的每個字段都發生對齊偏差。

印度文字系統。如梵文、泰米爾文及其變體。字符疊加且元音變音符號同時位於基字符的上方、下方和旁邊,這導致基於邊界框的提取器會誤讀或跳過整個音節。

來自同一來源的一個實用建議值得直接採納:使用區域級別的腳本檢測,而非文檔級別的語言標籤,這可以防止混合腳本文檔中的字段邊界溢出。一個文檔並不屬於某種語言,而是其各個區域分別屬於不同的語言。


真正的問題:沒有拼寫規則

這一發現應當塑造數據收集規範,它來自阿拉伯語腳本的自然語言處理社區,表達得尤為直接。

描述當說話者開始書寫一種方言時會發生的情況,無論是用於社交媒體、面向低識字群體的廣告,還是用於構建計算資源:

他們不為口頭表達制定規則,因為根本不存在規則。雖然有約定俗成的規範,但這些規範也容易被忽視,因為其目的只是傳遞信息,只要信息被接收方理解,接收方就可以靈活應對。

這種情況在世界大部分文本集合目標中普遍存在。摩洛哥阿拉伯語,即達裡雅,儘管長期致力於規範化書寫,仍顯示出顯著的差異。

其結果是結構性的。文本規範化,即把非標準拼寫和正字法變體映射到一致形式,從一個可選的優化步驟轉變為必須的流程環節,文獻報告指出,顯式規範化顯著提升了機器翻譯、語音識別後處理和形態標註等下游任務的性能。

對於一個文本集合項目,這會在任何文本收集之前就產生一個關鍵決策:是按原文收集,還是收集後進行規範化?兩者都有其合理性。按原文收集保留了人們實際的書寫方式,這對於模型需要讀取用戶生成文本的場景至關重要。規範化則產生了一致的語料庫,這在大多數訓練場景中是必需的。同時按原文收集並記錄規範化後的平行文本,是兼顧兩者的一種昂貴方案,這也是DATASHI平行語料庫旨在支持的方案。

將這一決策交由個別標註員決定是不可行的,因為最終會得到兩種結果,且無法分辨哪一種是正確的。


重音符號,這一具體未解決的情況

阿拉伯語重音符號值得單獨處理,因為該問題已被精確描述且仍然未解決。

重音符號恢復在阿拉伯語自然語言處理中被描述為一個持久且未解決的問題,其根源在於詞彙歧義、句法變化以及大多數書面文本中缺乏重音符號。

那最後一條是關鍵。阿拉伯語通常不寫元音符號,讀者會根據上下文推斷出這些符號。一個收集自然阿拉伯語文本的項目,實際上收集的是沒有元音符號的文本,而基於此類文本訓練的模型就會繼承這種歧義性。

2026年KSAA共享任務確立了當前的前沿:語音轉錄的自動加元音符號仍具有挑戰性,因為語音轉錄與傳統文本形式的加元音方法之間存在不匹配。語音識別系統產生的輸出通常是無元音符號或部分標準化的,而基於文本的加元音模型無法利用能夠解決歧義的語音信息。

阿拉伯文字還包含兩種不同的元音符號系統,值得在任何標註指南中明確指出:i'jām,即區分其他相同字母形式的點;tashkīl,即元音符號。它們是兩個不同的問題,一個籠統的‘處理元音符號’的說明並不能解決其中任何一個。

其他文字系統中的類似情況,我曾在一篇早期文章中提出過:豐貝語的音調符號在某些語料庫中保留,在其他語料庫中被移除,當數據集合並時就會產生不兼容性。這種模式具有普遍性。


形態學,以及詞彙爆炸的原因

另一個與阿拉伯語直接相關的因素,對數據有實際影響。

阿拉伯語詞彙具有多種形式,源自一個豐富的屈折系統,涵蓋性別、數量、人稱、時態、語氣、格以及若干可附加的附著詞。調查中給出的一個例子值得引用:wa+sa+ya-drus-uuna+ha,'他們將研究它',一個阿拉伯語單詞對應一個五詞的英文句子。

這對數據的影響是:與英語相比,其獨特詞彙類型數量顯著增加,這對機器學習模型構成挑戰,意味著一個相同詞元數量的語料庫中,每個詞彙類型的示例數量比例遠低於同等規模的英語語料庫。

實際意義在於,不同語言之間的token數量相等並不意味著覆蓋範圍相等。一百萬阿拉伯語token並不等同於一百萬英語token在每個詞形上的暴露程度,而一個範圍說明文件若僅以token數量為單位規定規模,卻未考慮形態豐富性,則對形態豐富的語言而言是規格不足的。


共享腳本並不意味著共享語言

一個常被忽略的區分,對語言識別和語料庫構建具有實際後果。

超過15億人使用共享腳本的語言。當語言共享腳本時,它們可能使用相同的字符表示不同的詞,或使用不同的字符表示同一個詞。

僅阿拉伯語腳本就涵蓋了波斯-阿拉伯語族語言,包括波斯語、烏爾都語、帕爾蒂語、索蘭尼庫爾德語、阿塞拜疆語、奧斯曼土耳其語、信德語和維吾爾語,以及非洲各地的阿賈米傳統,包括豪薩語、富拉語、沃洛夫語、斯瓦希里語、卡努里語、曼丁戈語和塔馬齊格特語。這些群體合計代表了近十億使用者,其中許多語言在自然語言處理領域仍處於資源匱乏狀態。

兩個實際後果。腳本檢測不等於語言識別,因此一個基於腳本的流程會將烏爾都語和波斯語合併。而一個通過腳本過濾構建的語料庫,無論其初衷是否為多語言,最終都會成為多語言語料庫。

反例同樣真實存在:一種語言使用多種腳本書寫。塔什利提特項目描述了一種混合數字正字法,與兩種腳本及蒂芬納格腳本並存,加劇了不一致性,併為文本規範化、分詞和語料庫對齊帶來了結構挑戰。


我們自身工作的契合點

聲明興趣:Lifewood在超過30個國家的交付中心收集覆蓋50多種語言和方言的文本數據,包括阿拉伯語腳本和印度語腳本語言。

兩個觀察點。

第一個是,正字法決策必須在數據收集之前完成,且需要母語使用者的判斷。

決定是否對達里亞語拼寫進行規範化,以及若要規範化,則採用何種標準,不是項目管理者可以從規格文檔中做出的決策。這需要那些撰寫該語言的人來決定哪些形式屬於同一個詞,並且需要以書面形式記錄為一種約定,附帶具體實例,而不是僅僅作為共享的理解。我此前在這一系列中已就此問題提出過關於西萊提語的情況,這一原則具有普遍性:對於沒有確立正字法的語言,該約定是交付成果的一部分。

第二個是,文字複雜性改變了標註員的要求,而不僅僅是工具的要求。

驗證天城文轉寫時,當附加符號位於基字符的上方、下方或旁邊,需要能夠流暢閱讀天城文的人,而不是僅僅能夠比較兩個字符串的人。同樣的情況也適用於阿拉伯語的上下文形式,其中一種在視覺上看似合理的錯誤形式對非讀者是不可見的。那些在預算時將文字複雜語言的處理按拉丁文字審查標準來計算的項目,會在質量保證階段發現這一問題。


規格檢查清單

將渲染與語言學問題分離。從右到左的顯示是實現層面的問題;應由工程團隊解決,不要將其與數據問題混淆。

在數據收集前決定正字法規範,需結合母語使用者的輸入和具體實例,並明確說明是收集原始拼寫、規範化形式,還是兩者並行收集。

明確指定附加符號的處理方式,區分那些用於區分字母的符號與用於表示元音的符號,特別是在該文字系統同時具備這兩種符號的情況下。

使用區域腳本檢測,而非文檔級語言標籤,處理混合腳本材料。

不要將腳本等同於語言。在腳本檢測之後增加一個語言識別階段,並預期其在共享腳本的密切相關語言上表現較差。

在目標覆蓋率中考慮形態學因素。對於形態豐富的語言,令牌等價性不等於覆蓋率等價性。

預算具備腳本識讀能力的評審員,而非字符串比較器,並據此定價。

檢查當您的語料庫與現有語料庫合併時會發生什麼。重音符號剝離、標準化約定和編碼格式是數據合併時無聲損壞的關鍵點。


關鍵要點

  • 阿拉伯語NLP研究人員將從右到左的排版描述為一個實際上已解決的問題,儘管尚未普遍實現。在該問題上出現的管道中斷屬於工程缺陷,而非研究問題。
  • 三大腳本家族驅動了大部分複雜性:從右到左且具有上下文形變的腳本、無空格的表意系統,以及帶有堆疊重音符號的印度語腳本。
  • 在拉丁文文檔上達到97%準確率的管道,在阿拉伯語或希伯來語上通常會下降到85%至90%。
  • 阿拉伯字符根據位置的不同,會呈現孤立、初顯、中位和末位形式,增加了識別器需要區分的視覺類別,而拉丁文字的大小寫變化並不完全依賴於位置。
  • CJK字符有超過20,000個標準統一漢字,傳統中文則超過50,000個,且沒有空格,因此一個單一的分段錯誤會導致後續所有字段的錯位對齊。
  • 天城文和泰米爾文會將字符疊加,並同時在基字符上方、下方和旁邊放置元音變音符號,導致邊界框提取器會跳過整個音節。
  • 應使用區域級別的腳本檢測,而非文檔級別的語言標籤,以防止字段邊界溢出。
  • 對於許多方言文字,沒有拼寫規則,慣例會發展並容易被忽視,即使在摩洛哥達裡雅語中也仍存在顯著差異,儘管已有系統化努力。
  • 文本規範化,即將各種拼寫變體映射到一致形式,顯著提升了下游機器翻譯、語音識別後處理和形態學標註的效果。
  • 在數據收集階段就要決定是採集原始書寫形式、規範化形式,還是兩者並行採集。將這一決策留給標註員會導致兩者同時出現,且無法區分。
  • 阿拉伯文變音符號恢復仍然是一個持續未解決的問題,其根源在於詞彙歧義、句法變化以及大多數書面文本中缺乏變音符號。
  • 阿拉伯文字包含兩個不同的變音符號系統,即i'jām用於區分字母,tashkīl用於標記元音,這些在規範說明中需要分別處理。
  • 阿拉伯語形態學會產生相當於五個英文單詞的單個單詞,詞彙類型遠多於英語,因此語言間token數量相等並不等於覆蓋範圍相等。
  • 超過15億人使用共享文字的語種,而共享文字對不同詞語使用相同字符,對相同詞語使用不同字符。
  • 僅阿拉伯文字就涵蓋了波斯-阿拉伯語族和非洲Ajami傳統,覆蓋近十億使用者,因此文字檢測不等於語言識別。
  • 一些語言同時使用多種文字書寫,例如Tashlhiyt在混合數字正字法和Tifinagh之間切換,給標準化、分詞和對齊帶來結構問題。

資料與進一步閱讀

常見問題

在標準層面並非如此。阿拉伯語自然語言處理研究人員認為,從右到左的排版實際上已基本解決,儘管尚未普遍實現。特定流程中的故障屬於實現缺陷,而非語言學難題。

孤立、初始、中段和末尾形式的上下文字符形狀,連筆連接和連字的識別,加上拼寫變化,缺乏變音符號以及用於文本處理的形態豐富性。

在數據收集前需做出決定。實際書寫形式保留了人們真實書寫的習慣,這對用戶生成內容尤為重要。標準化形式則為訓練提供了統一性。並行收集兩者可兼顧兩者需求,但成本更高。

因為大多數阿拉伯語書寫中都省略了變音符號,因此變音符號的恢復必須通過上下文來解決詞義模糊性和句法變化。基於語音的轉錄和基於文本的變音符號化方法目前也難以有效結合。

不能。超過15億人使用共享書寫系統的語言,僅阿拉伯語書寫系統就涵蓋了波斯-阿拉伯語系和非洲阿賈米傳統,覆蓋了近十億使用者。語言識別必須作為腳本檢測之後的一個獨立階段進行。

實際上需要。阿拉伯語的屈折變化和附著語素產生的獨特詞彙類型遠多於英語,因此在相同token數量下,模型每種形式的示例數量會更少。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊