AI 新發佈 ·

Olmo-core 3:架構、基準測試與擴展性能解析

Olmo-core 3 是一個開放式訓練框架,旨在高效將混合專家模型擴展至數萬億參數規模。

重點
  • 由 Allen Institute for AI 為大型混合專家模型打造。
  • 從完全分片數據平行轉為分佈式數據平行。
  • 在測試硬件上提供高達 2.7 倍的訓練吞吐量。
  • 已在 512 個 GPU 上完成高達 1.2 萬億參數的測試。
本文內容
  1. 什麼是 Olmo-core 3?
  2. Olmo-core 3 如何處理 MoE 訓練?
  3. Olmo-core 3 訓練吞吐量與基準測試
  4. MXFP8 支援與記憶體效率
  5. 擴展極限與測試觀察
  6. 常見問題

什麼是 Olmo-core 3?

Olmo-core 3 是由 Allen Institute for AI 開發的開放式訓練基礎設施框架,用於訓練大型混合專家語言模型。它既是未來 Olmo 版本基礎系統之一,也將底層工具公開給研究人員使用。

該框架旨在解決在 GPU 集群擴展稀疏模型時常遇到的高通訊與協調成本問題。它的架構設計能將訓練擴展至萬億參數範圍,同時不犧牲計算效率。

Olmo-core 3 一覽
開發者
Allen Institute for AI (Ai2)
主要用途
適用於大型 MoE 的可擴展訓練基礎設施
架構轉變
從 FSDP 轉為採用常駐專家的 DDP
支援精度
MXFP8 與 BF16
最大測試規模
2.38 萬億參數(容量測試)

Olmo-core 3 如何處理 MoE 訓練?

Olmo-core 3 以分佈式數據平行取代了先前的完全分片數據平行方法。它不會在每個 mini-batch 重複跨 GPU 收集和重新分片模型權重,而是將專家常駐於 GPU 記憶體中,並直接將 token 數據路由至專家。

Olmo-core 3 的硬件分佈依賴三種核心方法。專家平行將專家池切分到不同 GPU;流水線平行將網絡層分拆到不同 GPU 組;分佈式優化器則將優化器狀態分拆到各硬件,而非在所有地方重複複製。

為了降低路由開銷,技術棧將路由元數據留在 GPU 上,讓 CPU 能更快排隊任務。它還依賴分組 GEMM 來合併較小的專家計算,並利用按行專家平行將輸入數據直接放入專家緩衝區。

Olmo-core 3 訓練吞吐量與基準測試

與早期框架版本相比,Olmo-core 3 提供了更高的處理速度。Allen Institute for AI 報告指出,在 8 個 NVIDIA B300 GPU 的基準測試中,一個 470 億參數的 MoE 達到了每 GPU 每秒 52,000 個 token,高於早期 FSDP 實現的每秒 19,400 個 token。

2.7x8 個 B300 GPU 上的吞吐量提升
858 TFLOP/s512 個 GPU 上每 GPU 峰值計算量
21%使用 MXFP8 相比 BF16 的吞吐量增益

在容量擴展測試中,團隊將專家數量從 8 個增加到 128 個,同時每個 token 路由 4 個專家,保持激活參數固定在約 32 億。即使總模型參數從 46 億大幅增至 470 億,訓練吞吐量下降仍低於 5%。

MXFP8 支援與記憶體效率

Olmo-core 3 整合了對 MXFP8 的支援,這是一種使用較少位元儲存數值的低精度格式。這種簡化減少了計算負擔,並降低了分佈式訓練期間 GPU 之間傳輸的數據量。

在跨 4 個 NVIDIA B300 GPU 的對照測試中,啟用 MXFP8 比基準 BF16 精度產生了約 21% 的更高吞吐量。峰值激活記憶體消耗從 103 GiB 降至 95 GiB,大部分效率提升源於前饋運算與專家數據傳輸。

注意

Allen Institute for AI 指出,只有當數值節省超過格式轉換的計算成本時,MXFP8 才能帶來收益。

擴展極限與測試觀察

Olmo-core 3 在系統基準測試中展現了超過一萬億參數的擴展能力。在運行每個 token 具備 583.6 億激活參數的 1.2 萬億參數模型時,該框架在 512 個 NVIDIA B300 單元上達到了每 GPU 858 TFLOP/s,測試期間採用隨機路由以測試系統極限。

在採用 DeepEP v2 通訊的實驗性運行中,該框架在短暫的容量測試中配置了高達 2.38 萬億個參數。研究人員指出,此實驗旨在驗證硬件擴展邊界,而非持續的長期訓練質量。

研究報告還指出了一種名為 token 不公分配(token gerrymandering)的失效模式,即路由平衡得分看似提高,但物理分佈卻變得不那麼均勻。此外,由於個別專家處理的 token 較少而降低其學習率,並未能改善模型結果。

常見問題

什麼是 Olmo-core 3?
Olmo-core 3 是由 Allen Institute for AI 開發的開源訓練基礎設施框架。它旨在訓練規模達萬億參數級別的混合專家語言模型。
誰開發了 Olmo-core 3?
Olmo-core 3 由 Allen Institute for AI (Ai2) 開發。它是該機構支援 Olmo 模型家族的開源訓練框架的一部分。
Olmo-core 3 相比早期 Olmo-core 版本有何改進?
Olmo-core 3 以分佈式數據平行取代了完全分片數據平行,將模型專家常駐於 GPU 記憶體中。此設計通過消除重複的權重收集步驟,在測試硬件上實現了高達 2.7 倍的訓練吞吐量提升。
Olmo-core 3 支援哪些精度格式?
Olmo-core 3 支援 BF16 與較低精度的 MXFP8 格式。基準測試顯示,在測試的 NVIDIA B300 配置上,MXFP8 將訓練吞吐量提高了約 21%,並降低了峰值激活記憶體。
在 Olmo-core 3 上測試的最大規模是多少?
Olmo-core 3 在 512 個 NVIDIA B300 GPU 上針對 1.2 萬億參數模型進行了基準測試,達到了每 GPU 858 TFLOP/s。使用 DeepEP v2 的短暫容量測試實現了 2.38 萬億參數的配置。

資料來源:Hugging Face

想 AI 給出的答案是你的品牌?

免費檢查你的網站對 ChatGPT、Gemini 與 Perplexity 準備得有多好,約十秒完成。

延伸閱讀:如何讓 ChatGPT 引用你的品牌