# Olmo-core 3：架構、基準測試與擴展性能解析

作者：Schnalz.net · 2026年10月2日

https://schnalz.net/zh-HK/ai-guides/olmo-core-3-architecture-benchmarks-and-scaling

> Olmo-core 3 是一個開放式訓練框架，旨在高效將混合專家模型擴展至數萬億參數規模。

## 重點

- 由 Allen Institute for AI 為大型混合專家模型打造。
- 從完全分片數據平行轉為分佈式數據平行。
- 在測試硬件上提供高達 2.7 倍的訓練吞吐量。
- 已在 512 個 GPU 上完成高達 1.2 萬億參數的測試。

## 什麼是 Olmo-core 3？

Olmo-core 3 是由 Allen Institute for AI 開發的開放式訓練基礎設施框架，用於訓練大型混合專家語言模型。它既是未來 Olmo 版本基礎系統之一，也將底層工具公開給研究人員使用。

該框架旨在解決在 GPU 集群擴展稀疏模型時常遇到的高通訊與協調成本問題。它的架構設計能將訓練擴展至萬億參數範圍，同時不犧牲計算效率。

**Olmo-core 3 一覽**

- **開發者**：Allen Institute for AI (Ai2)
- **主要用途**：適用於大型 MoE 的可擴展訓練基礎設施
- **架構轉變**：從 FSDP 轉為採用常駐專家的 DDP
- **支援精度**：MXFP8 與 BF16
- **最大測試規模**：2.38 萬億參數（容量測試）

## Olmo-core 3 如何處理 MoE 訓練？

Olmo-core 3 以分佈式數據平行取代了先前的完全分片數據平行方法。它不會在每個 mini-batch 重複跨 GPU 收集和重新分片模型權重，而是將專家常駐於 GPU 記憶體中，並直接將 token 數據路由至專家。

Olmo-core 3 的硬件分佈依賴三種核心方法。專家平行將專家池切分到不同 GPU；流水線平行將網絡層分拆到不同 GPU 組；分佈式優化器則將優化器狀態分拆到各硬件，而非在所有地方重複複製。

為了降低路由開銷，技術棧將路由元數據留在 GPU 上，讓 CPU 能更快排隊任務。它還依賴分組 GEMM 來合併較小的專家計算，並利用按行專家平行將輸入數據直接放入專家緩衝區。

## Olmo-core 3 訓練吞吐量與基準測試

與早期框架版本相比，Olmo-core 3 提供了更高的處理速度。Allen Institute for AI 報告指出，在 8 個 NVIDIA B300 GPU 的基準測試中，一個 470 億參數的 MoE 達到了每 GPU 每秒 52,000 個 token，高於早期 FSDP 實現的每秒 19,400 個 token。

- **2.7x** 8 個 B300 GPU 上的吞吐量提升
- **858 TFLOP/s** 512 個 GPU 上每 GPU 峰值計算量
- **21%** 使用 MXFP8 相比 BF16 的吞吐量增益

在容量擴展測試中，團隊將專家數量從 8 個增加到 128 個，同時每個 token 路由 4 個專家，保持激活參數固定在約 32 億。即使總模型參數從 46 億大幅增至 470 億，訓練吞吐量下降仍低於 5%。

## MXFP8 支援與記憶體效率

Olmo-core 3 整合了對 MXFP8 的支援，這是一種使用較少位元儲存數值的低精度格式。這種簡化減少了計算負擔，並降低了分佈式訓練期間 GPU 之間傳輸的數據量。

在跨 4 個 NVIDIA B300 GPU 的對照測試中，啟用 MXFP8 比基準 BF16 精度產生了約 21% 的更高吞吐量。峰值激活記憶體消耗從 103 GiB 降至 95 GiB，大部分效率提升源於前饋運算與專家數據傳輸。

> **注意**：Allen Institute for AI 指出，只有當數值節省超過格式轉換的計算成本時，MXFP8 才能帶來收益。

## 擴展極限與測試觀察

Olmo-core 3 在系統基準測試中展現了超過一萬億參數的擴展能力。在運行每個 token 具備 583.6 億激活參數的 1.2 萬億參數模型時，該框架在 512 個 NVIDIA B300 單元上達到了每 GPU 858 TFLOP/s，測試期間採用隨機路由以測試系統極限。

在採用 DeepEP v2 通訊的實驗性運行中，該框架在短暫的容量測試中配置了高達 2.38 萬億個參數。研究人員指出，此實驗旨在驗證硬件擴展邊界，而非持續的長期訓練質量。

研究報告還指出了一種名為 token 不公分配（token gerrymandering）的失效模式，即路由平衡得分看似提高，但物理分佈卻變得不那麼均勻。此外，由於個別專家處理的 token 較少而降低其學習率，並未能改善模型結果。

## 常見問題

### 什麼是 Olmo-core 3？

Olmo-core 3 是由 Allen Institute for AI 開發的開源訓練基礎設施框架。它旨在訓練規模達萬億參數級別的混合專家語言模型。

### 誰開發了 Olmo-core 3？

Olmo-core 3 由 Allen Institute for AI (Ai2) 開發。它是該機構支援 Olmo 模型家族的開源訓練框架的一部分。

### Olmo-core 3 相比早期 Olmo-core 版本有何改進？

Olmo-core 3 以分佈式數據平行取代了完全分片數據平行，將模型專家常駐於 GPU 記憶體中。此設計通過消除重複的權重收集步驟，在測試硬件上實現了高達 2.7 倍的訓練吞吐量提升。

### Olmo-core 3 支援哪些精度格式？

Olmo-core 3 支援 BF16 與較低精度的 MXFP8 格式。基準測試顯示，在測試的 NVIDIA B300 配置上，MXFP8 將訓練吞吐量提高了約 21%，並降低了峰值激活記憶體。

### 在 Olmo-core 3 上測試的最大規模是多少？

Olmo-core 3 在 512 個 NVIDIA B300 GPU 上針對 1.2 萬億參數模型進行了基準測試，達到了每 GPU 858 TFLOP/s。使用 DeepEP v2 的短暫容量測試實現了 2.38 萬億參數的配置。

## 資料來源

- [Hugging Face：Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs](https://huggingface.co/blog/allenai/olmocore3)
