跳轉到主要內容
AI 數據

能否更多數據讓AI變差?

簡短回答:是的,而且在多語言工作中這經常發生。對205個網絡爬取的語言語料庫進行人工審計發現,至少有15個語料庫完全沒有可用文本,另有87個語料庫低於……

Mumu D. · 2026年9月1日 · 閱讀約 4 分鐘

簡短回答。 是的,在多語言項目中這經常成立。對205個網絡爬取的語言語料庫進行人工審核發現,至少有15個語料庫完全無法使用文本,另有87個文本可用率低於50%。添加這類低質量數據會使模型學習到錯誤的語言、錯誤的事實或完全空白內容,同時消耗本可用於驗證數據訓練的預算。當質量低於閾值時,數據量反而不再帶來幫助,反而開始造成損失。


添加數據為何會使模型變差?

通過三種機制,且隨著語言資源的減少,這些機制會越來越顯著。

它會擠佔優質數據的空間。訓練預算是有限的,因此每花費一個在混亂文檔上的token,就意味著沒有用於正確文檔上的token,而在低資源語言中,正確文檔本身就是稀缺資產。

它教錯了東西。一個被標註為一種語言但實際包含另一種語言的語料庫,並不會簡單地無法發揮作用。它會訓練出錯誤的關聯。

它會放大任何佔主導地位的內容。重複內容的學習比例被顯著放大,因此模板文本和爬取的重複內容變成了模型對語言的理解。

這種不對稱性至關重要。在英語中,噪聲被海量的乾淨文本稀釋。而在一個僅有幾十萬條可用句子的語言中,一個嘈雜的語料庫可能就是模型所看到的絕大部分內容。


網絡爬取的多語言數據實際上有多糟糕嗎?

比大多數團隊所認為的更糟糕,而且自2022年以來,相關證據已經公開。

Kreutzer及其同事手動審計了五個主要公開數據集所附帶的205個語言特定語料庫:

CCAligned, ParaCrawl, WikiMatrix, OSCAR 和 mC4。這些數據集的發現值得仔細閱讀,因為它們支撐了大量多語言模型的訓練。

至少有15個語料庫完全沒有可用文本,意味著在審計樣本中沒有一個正確句子。87種語言的可用數據低於50%。在CCAligned中,65個被審計的語言中有44個的正確句子比例低於50%,而在WikiMatrix中,20個語言中有19個低於50%。對於WikiMatrix,大約三分之二的審計樣本平均存在錯位,即句子對在結構上相似,卻描述了不同的事實。

另外,82個語料庫被錯誤標註或使用了非標準或模糊的語言代碼,這意味著該數據集並不真正可靠地反映它所聲稱的語言。

作者增加了一點值得鼓勵的內容:這些問題即使對不精通該語言的人來說也容易被發現。沒有人進行過檢查。


噪聲實際上由什麼構成?

四個反覆出現的類別,每個類別都需要不同的解決方案。

重複。在爬取的數據中冗餘現象非常嚴重:關於印地語語料庫的研究報告指出,大約70%的爬取頁面存在重複;而一個葡萄牙語數據管道通過在單次爬取內去重,就移除了約40%的剩餘頁面。

錯誤或錯誤標註的語言。內容屬於另一種語言,以該語言聲稱的羅馬化形式呈現,或使用了模糊的代碼。這是導致數據集主動誤導的失敗。

不匹配。在平行語料庫中,句子對並非彼此的翻譯。訓練在這些數據上的模型會學習到錯誤的等價關係,並表現出高度信心。

非語言內容。模板文本、導航內容、自動生成的文本、代碼片段和垃圾信息,在經過審計的低資源語料庫中均以顯著比例存在。

一個反直覺的發現值得了解:在不同爬取之間去除重複項可能會降低性能,因為它優先保留高熵噪聲頁面。清洗是一系列判斷,而不是一個開關。


團隊應該怎麼做才好呢?

在訓練前進行審核,積極過濾,並優先購買驗證而非數量。

每種語言都要審核一個樣本。一百個句子由一名說話者閱讀所獲得的信息,比語料庫的規模要多。這成本低廉,但幾乎沒有人這樣做。

將過濾視為一個性能槓桿。基於模型的過濾在僅有15%的標記數據的情況下,已經達到了基準測試的匹配結果。

應通過說話者來驗證語言身份,而不是僅依賴自動化語言識別,而後者恰恰在錯誤集中的地方表現最弱。

為每種語言設定一個可用標記下限。那些不可用的體積不應計入目標值。

優先選擇生成數據,而非稀疏的爬取數據。當數據量低於某個臨界點時,委託獲取經過驗證的本地語言數據比清洗一個從未可用的語料庫更便宜。

這一點正是運營合作伙伴發揮作用的地方。Lifewood在多語言領域的業務存在於這條鏈條的‘生產並驗證’一側:通過篩選過的母語者,覆蓋50多種語言,收集並核實語音和文本數據,並以元數據和質量歷史記錄的形式交付,從而實現可審計性。一個隨附其內容證據的數據集,與一個僅附帶token數量的數據集,是兩種截然不同的資產。


關鍵要點

  • 當數據量增加時,如果它擠佔了優質數據、導致錯誤關聯或放大重複內容,就會產生負面影響,這種影響在低資源語言中尤為顯著。
  • 對205個網絡爬取語料庫的審計發現,至少有15個語料庫無法使用,87個低於50%的可用文本比例,82個標籤錯誤或使用模糊的語言代碼。
  • 在65個經過審計的CCAligned語言中,有44個正確句子比例低於50%,在20個WikiMatrix語言中,有19個正確句子比例低於5及。
  • 噪聲以四種形式存在:重複內容、錯誤語言、平行語料中的對齊錯誤,以及非語言內容。
  • 在不同爬取任務之間進行去重,可能會保留高熵噪聲,從而降低性能,因此數據清洗更像是一種判斷,而非簡單的開關操作。
  • 經過過濾的多語言語料庫,在僅有15%的token數量的情況下,其表現仍與基準結果持平。
  • 每種語言都應進行樣本審計,由一名母語者驗證語言身份,設定可用token的最低門檻,並優先選擇生產數據,尤其是在爬取數據稀少的情況下。

資料與進一步閱讀

常見問題

不是。當數據質量低於某個閾值時,額外的數據會消耗訓練預算並引入噪聲,而在低資源語言中,這種噪聲不會被幹淨文本稀釋。

讓一位說話者朗讀每種語言的一百句樣本。用於暴露這些問題的審核採用了這種方法,並發現即使非母語者也能檢測到問題。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊