簡短回答。 因為翻譯會轉換詞語,卻保留其底層知識和假設不變。一個模型即使能夠流暢地用某種語言作答,也可能在生日聚會上吃的食物、適當的正式程度或請求的表達方式上出錯。這種差距非常大:在 BLEnD 評估基準(Myung 等,NeurIPS 2024 數據集與基準賽道)中,模型在用英語提問美國日常知識時平均得分為 79.22%,而在用阿姆哈拉語提問埃塞俄比亞日常知識時平均得分為 12.18%。這些知識很少被寫下來,因此無法通過網絡爬取或翻譯獲取——必須從實際生活其中的人們那裡收集起來。
請模型回答:去同事家做晚餐應該帶什麼。用英語提問時,模型給出了符合西方語境的合理回答。將該問題翻譯成孟加拉語後,模型給出的建議是關於葡萄酒的孟加拉語內容。沒有出現翻譯錯誤。該回答只是基於來自其他地方的知識構建而成,而翻譯步驟也忠實地傳遞了相關假設。
這是非本地團隊能夠運行的所有質量檢查都無法發現的失敗模式。語法正確,術語一致,語體合理,但內容在只有該市場本地讀者才能察覺的情況下是錯誤的。
為什麼僅靠翻譯是不夠的?
因為翻譯是一種應用於已被另一種文化塑造的內容的語言操作。詞語會改變,但世界觀不會。有三類內容難以被傳遞。
| 什麼難以被傳遞 | 代表案例 | 翻譯答案所產生的是什麼 |
|---|---|---|
| 日常實踐 | 人們所吃、所穿、所玩、所慶祝的內容 | 關於錯誤食物、錯誤禮物、錯誤場合的流暢建議 |
| 社會規範 | 正式程度、直接性、如何稱呼他人、什麼樣的拒絕被視為有禮貌 | 在表述上顯得粗魯或荒謬的註冊信息中,傳遞了正確的內容 |
| 參考點 | 法律術語、機構、支付方式、節日、單位 | 對市場中不存在的事物做出自信的引用 |
在上述三層之上,還有一層更難的問題。什麼讓一個回答是有幫助的、合適的或粗魯的,會因社會而異,一個在某個社會偏好上對齊的模型,會將這些偏好應用於所有場景。這不是更多事實就能彌補的知識差距;而是一種來自對齊數據的校準偏差。
文化差距有多大,可以量化嗎?
大到在某些市場中成為主導因素。
BLEnD正是為測試這一點而構建的:涵蓋16個國家和13種語言(包括阿姆哈拉語、豪薩語和巽他語)的52,600個問答對,由母語者手工製作,而非從網絡上抓取。以這種方式構建它至關重要,因為如果一個基準數據集是從網絡文本中抓取的,它將衡量的是模型已經學習過的相同在線資源。
| 測量 | 圖 |
|---|---|
| 美國英語日常知識問題的平均得分 | 79.22% |
| 埃塞俄比亞阿姆哈拉語日常知識問題的平均得分 | 12.18% |
| 最佳模型在不同文化間的表現跨度 | 最高可達57.34個百分點 |
| 覆蓋範圍 | 52,600對數據,16個國家,13種語言 |
標題下的兩個發現比標題本身更有用。
性能追蹤的是一個文化在線上的代表性程度,而不是其語言的難易程度。文化排名遵循其數字足跡。
對於低資源語言,模型用英語提問時的表現優於用本地語言提問時的表現。 對於中到高資源語言,情況則相反——模型在本地語言提問時表現更好。這一結果令人不安且明確:對於這些文化而言,模型通過英語瞭解的比通過其實際使用的語言瞭解的更多。它所吸收的一切知識,都來自外部描述,而非來自社區本身。
文化覆蓋差距 = 參照文化在其本族語言中的得分 − 目標文化在其本族語言中的得分
應以這種方式衡量,而非簡單地取整體多語言平均值。平均值會受到數據集中代表性較強的文化的主導,從而報告模型具備廣泛能力,而實際上它在特定市場中完全失效。
究竟缺少了什麼樣的知識?
是普通人普遍知曉卻從未被記錄下來的知識。BLEnD作者直接指出:人們在生日慶典上吃的食物、他們烹飪時使用的香料、年輕人喜愛的樂器、學校裡流行的運動。這些是當地普遍知曉卻在在線資料中罕見的知識。
你無法通過更頻繁地爬取數據或更多地翻譯來解決這個問題。沒有人認為這些知識需要被記錄,因此它只存在於人們的口頭傳承中。
這區分了文化能力與兩種常被混淆的概念。它並非語言覆蓋——一個模型可以精通某種語言,卻對使用該語言的文化一無所知,這正是阿姆哈拉語結果所展示的情況。它也並非在生產意義上的本地化,即調整格式、貨幣和日期等表面要素。這些只是對內容本質早已決定的要素進行的表面轉換。
這種差距在產品中具體體現在哪裡?
| 表面 | 文化鴻溝的表現是什麼 |
|---|---|
| 助手與聊天功能 | 流暢、自信卻毫無實際意義的建議——孟加拉語中的葡萄酒失敗案例 |
| 搜索與推薦 | 結果是基於另一個市場的假設進行排序的 |
| 內容生成 | 即使語法完美,內容仍讀起來像翻譯過的文本 |
| 評估 | 綠色儀表盤,因為測試集是從參考市場翻譯而來的 |
| 安全與適度 | 一個社會的規範被應用於另一個社會時,可能出現過度或不足的屏蔽問題 |
評估行是隱藏其餘所有內容的那一行。一個翻譯後的基準會將源文化帶入其中,可能導致模型在該市場中的排名錯誤——因此測量層會精確地重現它本應捕捉到的錯誤。
什麼能夠填補這一差距?
母語者以自己的語言創作和評判內容,然後相互驗證工作成果。沒有捷徑,因為輸入是生活經驗。四項實踐完成了大部分工作。
- 原語言作者;不得進行翻譯。 提示、回答和示例由該文化背景下的人員撰寫,而非從英文原文轉換而來。翻譯可以擴展覆蓋範圍,但無法提供從未存在於源語言中的知識。
- 刻意收集日常內容。 日常實踐是缺失的材料,因此必須明確提出。貢獻者不會主動提供他們認為人人皆知的內容;收集工具必須主動去尋找這些內容。
- 使用本地撰寫的測試集進行評估。 由該文化背景下的人員創作的內容,涵蓋日常知識、語氣和得體性。一個翻譯後的基準衡量的是翻譯質量。
- 在發佈後仍要保持人工參與閉環。 文化性錯誤對非該文化背景的人群而言,看起來流暢且正確——包括自動化檢查和基於模型的評分系統,它們都共享導致這些錯誤的假設。
在啟動此項工作時需要明確說明的內容
- 具體是哪些文化,且需與具體語言分開列出。這兩者並非同一列表,且一種語言可能涵蓋多個文化。
- 貢獻者目前是否居住在該市場,以及居住時長。 diaspora 知識會漂移,尤其是在日常實踐方面。
- 日常知識主題是如何被提取的,以及誰選擇了主題列表。
- 評估集是本地撰寫的還是翻譯的,以及由誰撰寫。
- 如何解決本地評審員之間的分歧,因為來自同一市場的兩個人可能存在合理差異。
- 對貢獻者的知情同意與公平補償——不僅因為這是正確的做法,而且因為罕見語言的貢獻者網絡一旦喪失便無法重建。
Lifewood的應對方式
這是Lifewood交付模型所基於的約束:在包含少數語言方言的50多種語言中進行收集、標註和評估,由經過篩選的母語者通過位於30多個國家的40多個交付中心完成,且在自動化檢查之上疊加了人工審核,準確率閾值達到95%以上。該網絡是分佈式的,因為文化知識無法移植——它必須在本地收集,而一名來自另一國家、使用翻譯指南工作的審核員無法提供這種本地文化知識。
參見多語言數據收集、全球AI數據,以及關於多語言大語言模型訓練數據質量和低資源語言語音數據收集的配套指南。
資料與進一步閱讀
- Myung等,《BLEnD:用於多樣化文化和語言日常知識的大語言模型基準》,NeurIPS 及2024年數據集與基準專題(arXiv 2406.09948)——上述所有圖表均引用自該文獻。