NVIDIAは、数学的推論に特化したデコーダーのみのTransformer言語モデル「Nemotron-3-Labs-Ultra-Math-RL」を公開しました。このモデルは、難解な数学問題の解決や証明における誤りの特定を行うように訓練されています。同モデルはアンサンブルシステムの一部として運用されており、2026年の国際数学オリンピック(IMO)において金メダル級のスコアを達成したとしています。
モデルのアーキテクチャには、Mamba2とTransformerを組み合わせたHybrid Latent Mixture of Experts(LatentMoE)が採用されており、Multi-Token Prediction(MTP)ネットワークを備えています。パラメータ数は総計550Bで、アクティブなパラメータ数は55Bです。最大コンテキスト長は100万トークンに対応しています。
このモデルは、強化学習を用いた数学的推論の向上を目的として開発されました。学習には、数学的な証明生成のためのデータセット「Nemotron-Math-Proofs-v3-RL」が使用されています。商用および非商用の両方で利用可能です。
出典:
- nvidia/Nemotron-3-Labs-Ultra-Math-RL(HF: NVIDIA、2026-09-02)