- 由 Allen Institute for AI 為大型混合專家模型打造。
- 從完全分片數據平行轉為分佈式數據平行。
- 在測試硬件上提供高達 2.7 倍的訓練吞吐量。
- 已在 512 個 GPU 上完成高達 1.2 萬億參數的測試。
什麼是 Olmo-core 3?
Olmo-core 3 是由 Allen Institute for AI 開發的開放式訓練基礎設施框架,用於訓練大型混合專家語言模型。它既是未來 Olmo 版本基礎系統之一,也將底層工具公開給研究人員使用。
該框架旨在解決在 GPU 集群擴展稀疏模型時常遇到的高通訊與協調成本問題。它的架構設計能將訓練擴展至萬億參數範圍,同時不犧牲計算效率。
- 開發者
- Allen Institute for AI (Ai2)
- 主要用途
- 適用於大型 MoE 的可擴展訓練基礎設施
- 架構轉變
- 從 FSDP 轉為採用常駐專家的 DDP
- 支援精度
- MXFP8 與 BF16
- 最大測試規模
- 2.38 萬億參數(容量測試)
Olmo-core 3 如何處理 MoE 訓練?
Olmo-core 3 以分佈式數據平行取代了先前的完全分片數據平行方法。它不會在每個 mini-batch 重複跨 GPU 收集和重新分片模型權重,而是將專家常駐於 GPU 記憶體中,並直接將 token 數據路由至專家。
Olmo-core 3 的硬件分佈依賴三種核心方法。專家平行將專家池切分到不同 GPU;流水線平行將網絡層分拆到不同 GPU 組;分佈式優化器則將優化器狀態分拆到各硬件,而非在所有地方重複複製。
為了降低路由開銷,技術棧將路由元數據留在 GPU 上,讓 CPU 能更快排隊任務。它還依賴分組 GEMM 來合併較小的專家計算,並利用按行專家平行將輸入數據直接放入專家緩衝區。
Olmo-core 3 訓練吞吐量與基準測試
與早期框架版本相比,Olmo-core 3 提供了更高的處理速度。Allen Institute for AI 報告指出,在 8 個 NVIDIA B300 GPU 的基準測試中,一個 470 億參數的 MoE 達到了每 GPU 每秒 52,000 個 token,高於早期 FSDP 實現的每秒 19,400 個 token。
在容量擴展測試中,團隊將專家數量從 8 個增加到 128 個,同時每個 token 路由 4 個專家,保持激活參數固定在約 32 億。即使總模型參數從 46 億大幅增至 470 億,訓練吞吐量下降仍低於 5%。
MXFP8 支援與記憶體效率
Olmo-core 3 整合了對 MXFP8 的支援,這是一種使用較少位元儲存數值的低精度格式。這種簡化減少了計算負擔,並降低了分佈式訓練期間 GPU 之間傳輸的數據量。
在跨 4 個 NVIDIA B300 GPU 的對照測試中,啟用 MXFP8 比基準 BF16 精度產生了約 21% 的更高吞吐量。峰值激活記憶體消耗從 103 GiB 降至 95 GiB,大部分效率提升源於前饋運算與專家數據傳輸。
Allen Institute for AI 指出,只有當數值節省超過格式轉換的計算成本時,MXFP8 才能帶來收益。
擴展極限與測試觀察
Olmo-core 3 在系統基準測試中展現了超過一萬億參數的擴展能力。在運行每個 token 具備 583.6 億激活參數的 1.2 萬億參數模型時,該框架在 512 個 NVIDIA B300 單元上達到了每 GPU 858 TFLOP/s,測試期間採用隨機路由以測試系統極限。
在採用 DeepEP v2 通訊的實驗性運行中,該框架在短暫的容量測試中配置了高達 2.38 萬億個參數。研究人員指出,此實驗旨在驗證硬件擴展邊界,而非持續的長期訓練質量。
研究報告還指出了一種名為 token 不公分配(token gerrymandering)的失效模式,即路由平衡得分看似提高,但物理分佈卻變得不那麼均勻。此外,由於個別專家處理的 token 較少而降低其學習率,並未能改善模型結果。
常見問題
什麼是 Olmo-core 3?
誰開發了 Olmo-core 3?
Olmo-core 3 相比早期 Olmo-core 版本有何改進?
Olmo-core 3 支援哪些精度格式?
在 Olmo-core 3 上測試的最大規模是多少?
資料來源:Hugging Face
想 AI 給出的答案是你的品牌?
免費檢查你的網站對 ChatGPT、Gemini 與 Perplexity 準備得有多好,約十秒完成。