日本語

モデル発表アレン人工知能研究所Olmo-core 3

Allen AI、スケーラブルなMixture of Experts(MoE)トレーニング・インフラを備えたOlmo-core 3をリリース

この記事は翻訳です。 原文を読む

Allen Institute for AIは、大規模言語モデル開発のためのフレームワークの大幅なアップグレードとなるOlmo-core 3をリリースしました。このアップデートでは、Mixture of Experts(MoE)アーキテクチャに特化して最適化された再設計済みのトレーニングシステムが特徴となっています。このアーキテクチャにより、入力ごとにパラメータの一部のみをアクティブ化することで、計算効率を維持しながら、モデルにより多くのパラメータを持たせることが可能になります。

Olmo-core 3は、MoEのトレーニングを1兆パラメータ規模までスケールさせるように設計されています。ベンチマークでは、トレーニングのスループットを維持したまま、1トークンあたりのアクティブなパラメータ数を約32億に固定しつつ、エキスパートのプールを8から128へと増やすことに成功しました。

新しいインフラストラクチャは、フルシャード・データ並列(FSDP)アプローチから、分散データ並列(DDP)に基づくシステムへと切り替わっています。この変更により、エキスパートをGPU上に常駐させ、データ them へとルーティングすることが可能になり、繰り返しの重み収集(weight gathering)を回避しています。8枚のNVIDIA B300 GPUを用いた予備テストでは、470億パラメータのMoEが、従来の実装と比較して約2.7倍のスループットを達成しました。

また、このフレームワークには、計算効率を向上させるためのrowwise expert parallelism、GPU-resident routing、grouped GEMMなどの複数の最適化が組み込まれています。さらに、Olmo-core 3は、計算コストとGPU間のデータ移動を削減できる低精度数値フォーマットであるMXFP8をサポートしています。テストの結果、NVIDIA B300 GPUにおいてMXFP8を有効にすることで、BF16のベースラインと比較してトレーニングのスループットを約21%向上させられることが示されました。

Olmo-core 3は、より高い能力を実現するためにMoEアーキテクチャの採用が見込まれる、次世代Olmoモデルの基盤となります。このフレームワークは、研究者や開発者が独自のMoEモデルをトレーニングし、さまざまなルーティングや並列化構成を実験できるように、オープンソースのツールとしてリリースされます。

出典

  1. Introducing Olmo-core 3: Open, scalable training infrastructure for large MoEs (Hugging Face Blog, 2026-10-01)
  2. Code