AIエージェント向けのオープンモデルの実行を最適化するために特別に設計された、Magnitudeという新しいオープンソースの推論エンジンがリリースされました。汎用的なエンジンとは異なり、Magnitudeは使用されている実際のデバイス上でカーネルをコンパイルおよびチューニングするため、ソフトウェアがハードウェアの特定のチップやメモリ構成に適合するように動作します。
64Kトークンのコンテキスト長を持つ4ビット量子化モデル「Qwen 3.6 35B A3B」を使用して、このエンジンをllama.cppと比較したベンチマークでは、Magnitudeは大幅なパフォーマンス向上を示しました。48GBのメモリを搭載したApple M4 Proにおいて、Magnitudeは約57トークン/秒の生成速度を記録し、これはllama.cppの30トークン/秒と比較して92%の向上となります。NVIDIA DGX Sparkを使用したCUDA環境では、Magnitudeは生成で約58トークン/秒、プリフィルで約2507トークン/秒を達成し、それぞれ19%と23%の向上を実現しました。
また、このエンジンは長時間のエージェントセッション中のメモリ使用量も最適化します。まずモデルの重みを保持するために必要なメモリのみを割り当て、セッションの進行に合わせて動的に割り当て量を増やします。エージェントが停止すると、割り当てられたメモリは解放され、ユーザーは同じPCで他のタスクを継続できます。さらに、Magnitudeは「プレフィックス・キャッシング」メカニズムを実装しており、これにより複数のセッションで共通のシステムプロンプトや反復的なテキストの計算結果を再利用できるため、頻繁に同様の指示を送るAIエージェントの効率が向上します。
MagnitudeはmacOS、Windows、Linuxをサポートしており、Apple Silicon、NVIDIA GPU、AMD GPU、およびCPUに対応しています。また、Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Clineといったさまざまなエージェントツールへのワンクリック接続に加え、OpenAI互換APIも提供しています。モデルをダウンロードした後は、システムは完全にオフラインで動作するため、プロンプトやファイルがローカルマシン内に保持されることが保証されます。
出典
- ハードウェアに合わせて自動最適化してオープンモデルを最大2倍高速化するAIエージェント向け推論エンジン「Magnitude」、Appleシリコン・NVIDIA・AMD・CPUに対応 (GIGAZINE, 2026-10-01)
- GitHub