簡短回答。 在主要對話數據集——DailyDialog、MultiWOZ、PERSONA-CHAT、XPersona、GlobalWOZ、XDailyDialog中,文化相關性幾乎完全缺失,而SEADialogues自稱是首個在每場對話中明確體現文化因素的數據集。翻譯無法解決這一問題:它保留了原語言並引入了場景,因此翻譯後的對話本質上是在目標語言中進行的外來情境。Hershcovich 和其同事認為,從大型本地社群中收集數據能夠產生更具文化內涵的數據,並避免將源自英語的場景強加於每一個市場。
跨文化場景?
SEADialogues論文中有一張對比表格,清晰地揭示了該領域的現狀令人尷尬。
該表格列出了主要對話數據集:DailyDialog、MultiWOZ、PERSONA-CHAT、XPersona、GlobalWOZ、Multi2WOZ、Multi3WOZ、XDailyDialog。其中部分數據集規模較大。XPersona涵蓋六種語言,包含104,600場對話。GlobalWOZ涵蓋21種語言。
而在最後一列‘文化相關性’中,所有數據集均被標記為‘否’。
SEADialogues 自稱是首個明確在每場對話中表示文化因素的對話數據集。其中多個多語言條目在標記是否避免翻譯的列中也帶有第二個交叉符號。GlobalWOZ、XPersona 和 XDailyDialog 都進行了翻譯。
因此,對於任何評估這項工作的人員而言,誠實的起點是:多語言對話數據確實存在,但具有文化根基的對話數據大多不存在,而且這兩者一直被當作同一件事來對待。
為什麼翻譯無法產生跨文化對話
原因在於,對話場景本身承載著文化,而翻譯只保留了詞語,卻保留了原場景的結構。
以一個任務導向的餐廳訂位對話為例。將其翻譯成爪哇語後,你得到的是一場使用爪哇語的關於西方餐廳訂位流程的對話,其中包含了西方人對預訂規範、用餐人數、付款方式以及如何稱呼服務員的假設。語言是正確的,但場景是被‘導入’的。
研究界已經為此命名。Hershcovich 及其同事認為,在大型本地社區內收集多語言數據,能夠產生更具文化深度的數據,並避免強加以英語為中心的使用場景。
COD 項目的方法涉及對外國概念的文化調整,將其替換為在標註員文化與環境中常見的概念,其作者指出,下一步應謹慎選擇與特定文化相關性及合理性相符的對話場景。
跨文化對話數據的成功與否,取決於場景選擇,而非翻譯質量。
一個紮根於文化背景的流程看起來是什麼樣子
兩個最近的數據集展示了足夠詳細的構建方法,可以進行復制。
SEADialogues覆蓋了八個東南亞語言,包括印度尼西亞語、爪哇語、馬來語、民丹卡巴烏語、塔加洛語、泰米爾語、泰語和越南語,覆蓋六個國家,產生了32,000個對話。
其流程從支持性資源開始,而不是從對話開始:場景模板、角色模板以及具有文化相關性的東南亞姓名。為每個對話,選擇兩個與領域相關的場景及其對應的角色,以確保場景內和場景間角色關係的一致性與連貫性,隨後進行手動詞彙化。
該數據集提供了300個場景和210個角色。這兩個數字是實際的文化內容。所有下游的生成和標註都是基於這兩個內容進行的。
CultureTalk-ID在單一國家範圍內進行了更深入的地理覆蓋。通過多階段的人工流程,涉及母語者構建而成,涵蓋了印度尼西亞的一般文化以及十個省份的文化,包括阿赫(Aceh)、西蘇門答臘(West Sumatra)、西爪哇(West Java)、中爪哇(Central Java)、東爪哇(East Java)、巴厘島(Bali)、東努沙登加拉(Nusa Tenggara Timur)、南加里曼丹(South Kalimantan)、南蘇拉威西(South Sulawesi)和西巴布亞(West Papua),橫跨印度尼西亞語和十個地方語言,共涵蓋十三個文化主題。
值得提取的設計要點是:他們將‘印度尼西亞文化’視為粒度不足,並按省份進行劃分。適用於方言範圍劃定的邏輯,同樣適用於文化範圍的劃定,原因相同。
社會規範,以及為何需要明確標註
本工作的最技術性有趣的方面涉及規範,因為規範是使對話對參與者而言感覺正確或錯誤的關鍵因素,而這些規範幾乎從未被明確標註。
NormDial 生成了 4,231 個雙人對話,總計 29,550 個對話輪次,覆蓋了中文化和美文化,每個對話輪次都標註了社會規範的遵守與違反情況。
他們的驗證流程是值得借鑑的部分。每種文化中都邀請了母語者手動評估每個生成的規範是否符合其自身的生活經驗,依據所定義的規範類別、特定於該文化以及在描述中詳盡說明的標準,剔除任何不滿足標準的情況。由此形成了 133 條中文規範和 134 條美式規範作為真實基準。
請注意‘根據他們自身的生活經驗’這一表述。並非‘根據某參考文獻’。對於文化內容而言,這才是正確的標準,而這種標準只能來自真正生活其中的人們。
RENOVI 將這一研究延伸至對話修復領域,包含 9,258 個多輪對話實例,並被描述為首個基於中國文化規範探索規範違反修復的語料庫。在標註方面,他們邀請了 20 名熟悉中國文化的大專院校講師和學生參與一個結構化的培訓流程。
NormGenesis 展示了支持此類建模所需的標註深度。對話輪次在 5 到 15 輪之間,每個發言都標註了規範遵守情況、說話人的反應(包括意圖和情緒狀態)以及對所分配標籤的說明,其中反應標籤基於對話行為理論建立。
第三個要素——說明,是罕見且寶貴的。一個沒有理由的標籤無法被審計,在文化標註中,理由往往是區分真正文化判斷與個人判斷的唯一方式。
所有研究背後的發現:現有模型在對話情境中往往無法正確推理規範的遵守與違反問題。
有效的本地化方法
對於任務導向型對話而言,多語言對話文獻中記錄了一種兩階段方法,值得了解,因為它比單次翻譯更穩健。
第一階段:母語者翻譯並本地化槽位值。餐廳名稱、菜品名稱、貨幣、地址、時間、尊稱等。
第二階段:另一組人類參與者翻譯或本地化整個語句,使用第一階段的槽位輸出結果。
將槽位本地化與語句本地化分開,可以避免常見錯誤:譯者因槽位值看起來像專有名詞而保留英文槽位值,導致泰語對話中出現‘從名為The Golden Lion的餐廳點一份凱撒沙拉’這樣的對話。
相同的來源對比了兩種哲學:在受控的自動程序下用目標語言對應項替換英文槽位值,與一種更依賴人類參與的方法,後者能更貼近目標語言社區的本地使用者。後者雖然較慢,但能產生更豐富的文化內容。
自然主義雙人對話收集
對於自發的日常對話而非構造性對話,2026年Hume-DaiKon語料庫展示了一種值得了解的收集設計。
它包含945個會話,總計743.4小時,覆蓋德語、英語、西班牙語、荷蘭語和波蘭語,通過一個雙通道對話平臺收集,該平臺連接來自相似地理區域的參與者對。
有三個設計細節值得借鑑。
參與者在參與前需完成音頻質量篩查,確保麥克風清晰度達到最低標準,而不是在後期處理中才發現問題。
他們用母語回應一個簡短的提示,例如‘你的週末怎麼樣?’這是一個提示而非腳本,從而產生自然流暢的口語表達。
該回應會自動通過語言模型進行檢查,以確認其既與提示相關,又在語言上流暢,這是在人工審核前的自動化篩選,與數據操作各環節所採用的相同架構。
並且按語言進行分層,測試集保持盲態。按語言分層再次出現,這是多語言數據工作各環節中反覆出現的紀律。
在合成生成適用的場景中,坦率地說
上述幾個數據集部分或完全為合成數據,由語言模型在專家提示下生成,並經過人工驗證。這一點值得坦率評估,而非簡單否定或過度熱情。
其論點由NormDial作者明確闡述:在該領域大規模收集真實數據具有挑戰性,且可能成本高昂,尤其是在識別不同文化背景下的規範遵守與違反方面。他們報告稱,其合成雙語對話在交互式人工評估和自動指標方面,其質量與現有自然生成數據集相當或更優。
關鍵的限定條件在於人類的參與位置。NormDial的流程在每個階段都包含人工驗證,而這些規範本身也是由母語者依據實際生活經驗進行驗證的,在任何對話生成之前均已完成驗證。合成對話運行在由人類構建的文化框架內。
在評估供應商或數據集時,這一點至關重要。基於母語驗證的文化規範的合成對話是一種合法方法。而通過提示模型生成‘兩位印度尼西亞朋友之間的對話’的合成對話,則是模型對印度尼西亞對話的刻板印象,這種對話在任何印度尼西亞人看來都會顯得如此。
我們自身工作的契合點
關於興趣的聲明:Lifewood通過位於全球超過30個國家的交付中心,收集涵蓋50多種語言和方言的對話數據,其中包括這些數據集所覆蓋的多個東南亞市場。
兩個觀察點。
第一個觀察是,情景庫是交付成果,而非對話本身。SEADialogues構建了300個場景和210個角色,並基於這些內容生成了32,000條對話。如果這些場景具有文化準確性,對話可以隨之擴展。但如果這些場景是直接導入並翻譯的,無論生成多少對話都無法解決這一問題。在規劃此項工作時,應向供應商詢問的是場景的來源,而非他們將交付多少對話。
第二個觀察是,文化細粒度需要像方言細粒度一樣明確決定。CultureTalk-ID在印度尼西亞國內按省進行構建,因為‘印度尼西亞文化’這一概念分辨率不足。這一決策具有成本和合理性,應體現在範圍文件中,而不是默認解決。一個被標記為‘印度尼西亞語’的數據集,如果完全在雅加達收集,則本質上是雅加達的數據集,而交付統計中沒有任何內容能說明這一點。
範圍檢查清單
明確具體場景,而不僅僅是語言。這些場景源自何處?是誰驗證了它們在該文化中的合理性?
明確決定文化粒度,分別在國家級、省級或社區層面,並提供明確的說明理由。
招募具有實際生活經驗的人員,因為有效的驗證標準是該規範是否符合標註員自身的實際生活經驗,而非參照標準。
將槽位值的本地化與短語的本地化分開處理,並分兩個階段由不同人員完成。
在涉及社會適宜性的應用場景中,明確標註規範,包括遵守情況、反應以及對標籤的解釋依據。
在自發性數據收集過程中使用提示(prompts)而非腳本,會話前進行音頻篩選,會話後進行自動化相關性檢查。
按語言進行分層,包括評估劃分。
對合成內容要明確說明。經人工驗證的規範作為基礎模型生成對話的支撐,是一種方法;未經驗證的生成則屬於刻板印象。
關鍵要點
- 在包括DailyDialog、MultiWOZ、PERSONA-CHAT、XPersona、GlobalWOZ和XDailyDialog在內的主要對話數據集中,文化相關性缺失,其中多個多語言數據集是通過翻譯而非本地創建實現的。
- SEADialogues稱自己是首個在每場對話中明確表示文化要素的數據集。
- 翻譯保留了語言並引入了場景,因此翻譯後的對話是一種在目標語言中進行的外國情境。
- Hershcovich及其同事認為,在大型本地社區中收集數據能夠產生更豐富的文化數據,並避免強加以英語為中心的使用場景。
- SEADialogues覆蓋了六個國家的八個東南亞語言,包含32,000個對話,基於300個場景和210個角色,以及具有文化相關性的名稱構建而成。
- CultureTalk-ID涵蓋了印度尼西亞的一般文化以及十個省份,包括印度尼西亞語和十個地方語言,覆蓋了十三個文化主題,認為國家級文化粒度不足。
- NormDial產生了4,231個雙人對話和29,550個回合,涵蓋中文化和美文化,並在每個回合中標註了規範的遵守與違反情況。
- NormDial的規範驗證標準是:由母語者根據自身的生活經驗、特定文化背景、分類明確且細節充分地判斷每個規範是否屬實,最終得出133箇中文規範和134個美國規範。
- RENOVI 包含 9,258 個多輪實例,被描述為首個針對規範違反修復問題進行標註的數據集,由 20 位熟悉中國文化背景的大學講師和學生共同完成標註。
- NormGenesis 為每一條 5 到 15 輪對話中的發言,標註了規範遵守情況、說話人反應(包括意圖和情緒狀態)以及標籤的合理性說明。
- 現有模型在會話場景中對規範遵守與違反的推理往往存在錯誤。
- 任務導向的本地化工作效果最佳,分為兩個階段:首先由母語者完成槽位值的本地化,然後由另一組人員基於該輸出完成完整短語的本地化。
- Hume-DaiKon 收集了 945 個自然主義的雙人會話,總計 743.4 小時,覆蓋五種語言,會話前進行音頻篩選,使用母語提示而非劇本,同時通過自動化手段進行相關性與流暢性檢查。
- 當合成對話基於經母語驗證的文化規範並經過每階段的人工驗證時,是合法的;若在缺乏該框架下生成,則會產生刻板印象。
資料與進一步閱讀
- "SEADialogues:一個基於東南亞語言的文化相關多輪對話數據集",arXiv,關於與現有對話數據集的對比,八語言六國範圍,以及場景與角色流程
- "CultureTalk-ID:一種針對印度尼西亞地方語言文化常識的多任務對話基準測試", arXiv, 關於多階段母語者流程及覆蓋十個省區和十三個主題的真實基準
- "NormDial: 一個用於建模社會規範遵守與違反的可比雙語合成對話數據集", arXiv, 關於4,231個對話、29,550個語句、母語者驗證標準以及模型對規範的推理發現
- NormDial, EMNLP 2023會議論文, 介紹包含每階段均有人工驗證的四階段流程以及最終生成的133箇中文和134個美國規範
- "RENOVI: 一個旨在修復社會文化對話中規範違反的基準", arXiv, 關於9,258個對話實例以及由20名大學講師和學生參與的標註員培訓流程
- "NormGenesis: 通過範例引導的社會規範建模與違反恢復實現多文化對話生成", arXiv, 關於語句級標註規範遵守、說話人反應及理由
- "跨越對話鴻溝:多語言任務導向對話系統中的NLP入門", arXiv, 關於兩階段槽位和短語定位以及Hershcovich等人提出的基於社區的收集論點
- "2026年ACII雙人對話(DaiKon)研討會與挑戰", arXiv, 關於Hume-DaiKon語料庫的規模、語言種類、音頻篩選、母語提示以及自動化流暢性檢查
- "通過大綱生成實現跨語言對話數據集創建", TACL, 關於文化適應、外來概念的替換以及場景合理性選擇
- Lifewood, 對話及多語言數據收集