NVIDIAは、Alibabaが開発した自己回帰型言語モデル「Qwen3.8-27B」の量子化バージョンを提供しています。このモデルは、NVIDIAのModel Optimizerを使用して、NVFP4とFP8を組み合わせた混合精度で量子化されています。
量子化の仕様として、MLP層と言語モデルのヘッド(lm_head)にはNVFP4が、セルフアテンションおよびリニアアテンション層にはFP8が適用されています。このチェックポイントは、vLLMを用いて配信可能です。また、NVIDIA Grace Blackwell GB300をテストハードウェアとして使用しています。
当該モデルは、テキスト、画像、ビデオの入力をサポートしており、最大262,144トークンのコンテキスト長を持ちます。出力はテキスト形式です。なお、このモデルはNVIDIAによって開発されたものではなく、サードパーティの要件に基づいて構築されたものです。
出典:
- nvidia/Qwen3.8-27B-NVFP4(HF: NVIDIA、2026-09-04)