· ローカルAI

GLM-5.3-Flash 320B MoEを4枚のCMP 170HXで動かすvLLMレシピ

30秒でわかる内容解説

Morrowmakeが2026年9月25日、320BパラメータのMoEモデルGLM-5.3-Flashを4枚のNVIDIA CMP 170HXで動作させるレシピを公開した。独自フォークの推論エンジンと高速化技術を組み合わせ、単一ユーザーで264.6 tok/sの生成速度を実現している。Ampereアーキテクチャの比較的古いGPUでも大規模モデルが実用に耐える速さで動くことを示した。ローカル環境で高機能な言語モデルを運用したい技術者にとって参考になる構成だ。

OpenAI互換APIで動く320BパラメータのMoE構成

Morrowmakeが2026年9月25日、320BパラメータのMoEモデルGLM-5.3-Flashを4枚のNVIDIA CMP 170HXで動作させるレシピを公開した。独自フォークの推論エンジンと高速化技術を組み合わせ、単一ユーザーで264.6 tok/sの生成速度を実現している。Ampereアーキテクチャの比較的古いGPUでも大規模モデルが実用に耐える速さで動くことを示した。

ローカル環境で高機能な言語モデルを運用したい技術者にとって参考になる構成だ。

基盤となるモデルはzai-orgが公開したGLM-5.3-Flashで、重みはW4A16量子化でINT4に圧縮され活性化はFP16を維持する。KVキャッシュは量子化せずCPUやディスクへのオフロードも行わない。推論エンジンにはMorrowmakeが開発したvLLMのフォークを使用し、標準のHopper向けスパースアテンションをAmpere向けに再実装した。

DFlash2スペキュラティブデコーダを併用し、8ユーザー並列時で合計745.4 tok/sを記録している。コンテキストウィンドウは262,144トークンをサポートし、127.0.0.1のポート8000でOpenAI互換APIを提供する。ツール呼び出しや画像・動画処理も有効になっている。

Ampere世代のGPU向けに最適化された独自カーネル群

CMP 170HXはもともとデータセンターのレンダリング向けに設計されたカードだ。標準状態ではPCIeリンクがx4に制限されメモリも64 GiB未満で動作する。レシピでは64 GiBとx16リンクに改造したカードを4枚並べることを前提としている。x16リンクにすることでテンソル並列処理の通信帯域制限を回避した。

推論中のGPU間通信は、標準ではホストメモリを経由するマルチホップパスで遅い。フォークは共有ホストメモリを使ったホストステージドアールレダを実装し、通信オーバーヘッドを削減した。さらにPCIeピアツーピア機能が有効な環境では、デバイスメモリ間で直接データ転送するオプションも用意されている。

決定論的な挙動も保証されている。リスタートを繰り返しても同じ入力で同じトークン列が返るよう、MoEのブロック配置順序やCUDAグラフの埋め込み行、インデクサのtop-k処理を固定した。これにより再現性が向上し、開発時のデバッグが容易になっている。

カスタムカーネルはmHC混合やMoEルーティングを統合し、小さなバッチサイズ向けに最適化した。W4A16量子化で一部残るBF16層も、cuBLASが苦手とする薄型バッチ処理に特化したカーネルで高速化した。LinuxとNVIDIAドライバー580、CUDA 13.xを必要とする。

26万トークンコンテキストでも正確な位置 retrieval を達成

品質検証では、固定された60文書のセットでパープレキシティ3.2858を記録した。数学問題のGSM8Kでは0.975、コード生成のHumanEvalでは0.9573のスコアを示している。HumanEvalでは4,096トークンの制限内でコードブロックを生成し、164件中157件が成功した。

長文コンテキストの保持能力も確認されている。262,144トークンのコンテキストウィンドウで針検索テストを実施し、8,000トークンから262,000トークンまでの範囲で正確な位置 retrieval を達成した。262,000トークン地点の正確な文章コピーもバイト単位で一致した。

並列リクエスト間でもデータリークがなく、処理時の安定性も裏付けられた。推論速度の最適化は品質劣化を伴わず、カスタムカーネルの精度も高精度リファレンスと同等以上を維持している。

x4カード向けパイプライン並列と環境依存のP2P機能

現在準備中の機能として、PCIeリンクがx4のカード向けに最適化されたパイプライン並列4構成がある。バス帯域幅に縛られて大幅に低速になる問題を解決し、後続リリースで提供される予定だ。

PCIeピアツーピア機能の利用可否は、マザーボードのトポロジーやドライバーのバージョンに依存する。EPYC搭載のマシンでは全てのカードペアで有効だが、Xeon搭載機ではPLXスイッチの背後で機能が制限される場合がある。環境によって速度差が生じるため、事前の検証が推奨される。

動作環境はLinux上でNVIDIAドライバー580以降とCUDA 13.xツールキットを必要とする。日本語ユーザー向けの日本語プロンプトや日本語対応のツール呼び出しパーサーも組み込まれており、国内のローカルAI環境での実用性が高い構成だ。

設定ファイルでコンテキスト長や並列リクエスト数、量子化の深さを調整できる。モデルのチェックポイントとフォークのソースコード、コンパイルキャッシュで合計200 GiB前後のディスク容量を消費する。2026年9月下旬から利用可能となり、継続的なカーネル改良が進められている。

動作に必要なハードウェアとOSの要件
項目値
GPU4× NVIDIA CMP 170HX (64 GiB, PCIe x16)
OSLinux (Ubuntu)
ドライバーNVIDIA 580以降
CUDA13.x
ディスク約200 GiB

出典