跳轉到主要內容
AI 數據

如何在長上下文數據上訓練大語言模型

簡短回答。通過超越簡單的令牌擴展,轉向結構化、高密度的精煉,解決‘中間迷失’問題

Mumu D. · 2026年8月8日 · 閱讀約 6 分鐘

簡短回答。 通過超越簡單的令牌擴展,轉向結構化、高密度的精煉,解決‘中間迷失’的問題

通過超越簡單的令牌擴展,轉向結構化、高密度的精煉,解決‘中間迷失’的現象。儘管現代架構——如Ring Attention和FlashAttention-3——使上下文窗口可以從128k擴展到超過200萬令牌,但模型的能力僅取決於其輸入數據的連貫性。訓練長上下文的大語言模型(LLMs)需要包含跨多頁企業文檔、倉庫級代碼庫和多小時對話轉錄的複雜依賴鏈的專用數據集。

如果沒有嚴格的人工參與閉環來消除噪聲、驗證跨文檔依賴關係並確保結構完整性,僅僅擴大上下文窗口只會導致更高的計算成本和更嚴重的幻覺率。

  • 為什麼上下文長度擴展本質上是一個數據質量問題?

  • 文檔結構如何影響長上下文檢索和推理?

  • 多文件代碼庫在長上下文訓練中具有哪些獨特性?

  • 如何為長上下文大語言模型準備多小時的音頻轉錄文本?

  • 如何衡量和驗證長上下文數據的質量?


為什麼上下文長度擴展本質上是一個數據質量問題?

由於模型架構在技術上可以處理數百萬個標記,但如果訓練數據缺乏密集且長距離的依賴關係,那麼回憶和推理能力會迅速衰減。

生成式人工智能的發展已經從優化參數規模轉向擴展模型的活躍工作內存。2023年,32k標記窗口被視為最先進的水平;而如今,企業應用通常要求100萬以上標記窗口,能夠在一個提示中攝入整個法律檔案、複雜代碼庫或多小時的音頻記錄。

然而,最近的實證基準分析——包括針對針尖在 haystack(NIAH)變體、L-Eval 和 LongBench 的測試——均顯示了一個持續存在的故障模式:‘迷失於中間’現象。大語言模型在輸入窗口的開頭(首因效應)或結尾(近因效應)處的信息檢索準確率較高,而在上下文中間60%區域的檢索性能則顯著下降。

~95% ~90% 35% - 50% 初始階段 損失在中間區域 結束(優先效應:0k - 100k)

(60% 中文上下文下降:500k - 1.2M)

(最近效應:1.8M - 2M+)

為克服這一結構侷限,長上下文預訓練和微調(SFT/RLHF)不能簡單地將隨機短文檔拼接在一起。訓練數據集必須包含明確的多跳依賴關係,其中解決查詢需要從整個序列中提取並綜合分佈的事實。


文檔結構如何影響長上下文檢索和推理?

無結構的長文本會導致高困惑度和檢索失敗;分層標記和跨頁實體定位保留了邏輯流程。

企業文檔——例如財務審計、監管文件、保險政策和臨床試驗——很少是線性敘述。它們是視覺和結構化的產物,包含嵌套表格、多列布局、標題層級、腳註和交叉引用。粗暴的純文本提取會剝離關鍵的結構信號。

原始解析(上下文丟失)

結構化整理(Lifewood 工作流)

請參見第4.2.1節。'Obligor'一詞指的是展覽B中列出的各方。

'Obligor'一詞指的是在結果:當展覽B距離為40萬tokens且無語義標籤時,模型會丟失關聯的情況下所確定的各方。

附件B。

結果:保持跨頁實體定位和精確關聯。

長文檔數據編纂的關鍵考慮因素:

  • 表格到文本的保真度:複雜的財務表格必須轉換為結構化格式(Markdown、HTML或JSON),並明確重複表頭,以確保深層行在上下文斷開時仍能保持語義上下文。

  • 跨文檔核心指代解析:長上下文模型必須學會在500多頁之間追蹤實體。

人工標註員需驗證所有代詞引用和縮寫術語在整個語料庫中始終保持明確的關聯。

  • 文檔佈局保留:保留空間和層級元數據,確保模型注意力頭在執行針狀檢索任務時能夠利用結構線索。

多文件代碼庫在長上下文訓練中具有哪些獨特性?

代碼庫訓練需要倉庫級依賴圖映射,確保模型掌握多個模塊之間的非線性架構關係。

僅對單個文件進行大語言模型的代碼生成或調試訓練已不再足夠。開發者期望模型能夠理解完整的代碼庫,重構遺留系統,並解決跨越數十個微服務的缺陷。代碼庫長上下文數據從根本上不同,因為代碼執行是非線性的。

src/core/base.py 基礎工具定義 → src/auth/session.py 繼承並擴展基礎 → src/api/v1/end及點.py 實例化會話端點 代碼庫數據集的核心組件:

  • 倉庫拓撲映射:按字母順序導入文件會破壞依賴解析。數據集必須按照拓撲依賴圖(例如,AST/調用圖順序)進行排序。

  • • 提交歷史與合併請求上下文:將合併請求描述、問題工單和提交差異與完整代碼庫一同提供,教導模型為何在數千行代碼中發生了變更。

• 多語言架構:長上下文數據集必須包含跨多語言棧的各服務API契約(GraphQL、OpenAPI、Protobuf),以彌合語言邊界。


如何為長上下文大語言模型準備多小時的音頻轉錄文本?

通過將多說話人音頻對齊與精確說話人分離、元數據標記以及領域特定詞彙標準化相結合。

對話數據——例如財報電話會議、董事會會議、法律質證和臨床諮詢——是增長最快的使用場景之一。一場四小時的會議錄音會產生數萬條口語內容,包含重疊音頻、中斷和口語表達。標準自動語音識別(ASR)輸出通常過於嘈雜;在數萬個標記中,微小的轉錄錯誤會不斷累積。

未經處理的ASR輸出與經過整理、標明說話人的數據集對比。原始轉寫:“是啊,嗯,關於第三季度的數字,呃,我想我們達到了大概4200萬,如果算上歐洲的交易,可能是4300萬,對吧,Sara?”整理後的記錄:[時間戳:01:14:22] [說話人:CFO_Michael] “關於第三季度的收入指標:已確認的總收入達到……”

4250萬美元(含歐洲擴展合同)。

[交叉引用:關聯演示文稿第14頁] 提升轉錄數據質量的步驟:

  • 說話人分離與持久性:確保在長達3小時的轉錄文本中,即使存在長時間的靜音,說話人標籤也保持一致。

  • 時間與內容同步:將口語轉錄內容與配套的視覺元素(如幻燈片、共享屏幕、會議議程)對齊。

  • 領域詞彙錨定:糾正專業術語、醫學術語和專有公司名稱。


如何衡量和驗證長上下文數據的質量?

通過多階段人工參與閉環驗證、合成針頭注射測試以及任務特定的評估套件。


原始攝入


結構解析


人工質量審核


合成注入


最終交付

PDFs、代碼倉庫、音頻AST及元數據 50多種語言 多跳檢索 >99.9% 準確率 長上下文 質量度量 比較指標 依賴密度 語音分割精度 語法樹完整性 目標標準 主要目的 失敗模式 若忽略 >3個明確鏈接每10k 使模型維持長範圍注意力 匹配 >99.2% 說話者 確保語音說話者跟蹤 準確性錯誤出現在對話轉錄摘要中 保證代碼倉庫 結構有效性破壞的代碼生成 100% 可解析的AST 指標 目標標準 事實分佈 在序列上均勻分佈 主要目的 消除"中間迷失"偏差 失敗模式 若忽略 中文檔檢索錯誤率高


關鍵要點

    • 架構擴展 需要數據擴展:將LLM上下文窗口擴展到100萬以上token,在沒有專門設計具有長距離邏輯依賴的數據集的情況下是無效的。
    • 結構 消除"中間迷失":非結構化文本在上下文窗口中間60%部分召回率下降。
  • 分層標註與跨頁實體解析有助於保持檢索準確性。
    • 代碼倉庫需要依賴圖:代碼數據集必須遵循調用圖順序,而非任意文件順序。
    • 語音轉錄需要說話人持久性:多小時音頻數據集需要高精度的說話人分離和領域詞彙規範化。
    • 必須引入人工參與閉環:雙層人工驗證確保數據集達到用於生產級長上下文模型所需的精度。

常見問題

RAG在查詢時動態從外部數據庫獲取相關文本片段,並將其插入到短上下文窗口中。長上下文微調則訓練模型的原生權重,使其能夠處理、保持並推理長達數百萬令牌的連續序列,無需依賴向量分塊。

將不相關的短文檔拼接會增加序列長度,但並不能教會模型建立長距離依賴關係。模型學會了超出幾千個標記之外的上下文是無關的,從而加劇了‘中間丟失’的檢索退化問題。

Lifewood運營著安全、企業級的交付中心,配備嚴格的訪問控制、數據匿名化流程以及合規標準(包括GDPR和SOC 2)。工作流可以在隔離網絡環境中或專屬客戶基礎設施上執行。

Lifewood支持超過50種語言和方言,涵蓋多種格式,包括非結構化PDF文件、掃描的舊文檔、多文件軟件倉庫(GitHub/GitLab樹結構)以及多軌音頻格式。

正在規劃 AI 項目或提升品牌可見度?

從 AI 評估、人工參與審核,到 GEO 與 AEO 策略,我們的團隊幫助你穩妥落地項目,在 AI 搜索時代獲得更多關注。

聯繫我們的團隊