· ローカルAI

GLM-5.3とDeepSeek V4シリーズのPCIe多GPU推論最適化リポジトリ公開

20秒でわかる内容解説

2026年10月9日、GitHubユーザーzhangjk1207がPCIe接続の複数GPU環境向け推論最適化リポジトリを公開した。GLM-5.3-FlashやDeepSeek-V4シリーズを対象に、デプロイメントスクリプトや並列実測データを提供する。自前のPCで複数カードを繋ぎモデルを動かす技術者向けに、設定手順と性能改善の経緯をまとめている。

多GPU環境向け最適化スクリプトの公開

公開されたリポジトリは、GLM-5.3-Flash W4A16とDeepSeek-V4シリーズのPCIeバス(複数GPU間を繋ぐデータ伝送路)多カード推論向けに設計された。主要な最適化項目としてCUDA graph(計算処理の記録と再生機能)の範囲拡張、投機デコーディング、マルチカード通信、KVキャッシュ(プロンプトや生成結果の記憶領域)管理が挙げられる。

各モデルにはA800やA40などのGPU環境に対応したデプロイメントスクリプトが同梱されている。ユーザーはModelScopeからモデルをダウンロードし、スクリプトを実行するだけで推論サーバーを起動できる。

主要な環境設定値
項目値
対象モデルGLM-5.3-Flash W4A16、DeepSeek-V4シリーズ
推奨GPUA800 80GB、A40 48GB
使用フレームワークvLLM v0.13.1
通信プロトコルNCCL、CustomAllreduce

PCIeバスと通信プロトコルの最適化経緯

PCIeバスで接続された複数GPU間はNVLink(専用高速リンク)のような高速リンクを持たないため、カード間のデータ転送がボトルネックになりやすい。このリポジトリではCUDA graph機能を活用し、推論処理の計算グラフを事前に記録して再生する範囲を広げた。これにより計算のオーバーヘッドを削減できる。

またNCCL P2P(カード間の直接通信プロトコル)の状態によって初期化時の通信がブロックする場合があるため、環境に応じて無効化フラグを設定する必要がある。

KVキャッシュは過去のプロンプトや生成結果を記憶する領域で、CPUメモリに預ける設定も推奨されている。各ノードのGPU構成はSM80やSM86(GPUのアーキテクチャ世代)に合わせて最適化されたコンテナイメージが提供される。通信経路にはPIX、PXB、SYSの3種類があり、ノード内とノード間でパスが異なる。データ転送の効率化を図るため、バッチ処理時のトークン数やGPUメモリの使用割合を0.95程度に抑える設定が標準で含まれている。

並列実測データと性能改善の推移

実測データでは、モデルとGPU構成によって最適化の効果が分かれた。GLM-5.3-Flashの4カード並列テストでは、1路と2路、16路で明確な性能向上が確認された。8路の場合のみ約715 token/sでほぼ横ばいとなった。

DeepSeek-V4-FlashではCUDA graphの捕捉範囲を広げた結果、6路以上で生じていたスループットの急減が解消された。6路で約236%、8路で約211%、16路で約111%の向上を示している。

扩展图捕获范围后,6 路及以上的吞吐断崖消失。

拡張図捕捉範囲後、6路以上のスループット断崖は消失した。

DeepSeek-V4.1-Flashの8カード構成では、最大シーケンス数を4から8へ拡張しP2Pを有効にしたことで、8路の集約スループットが340.7から583.3 token/sへ改善した。TTFT(最初の応答までの待ち時間)も2.3秒台から0.7秒前後に短縮された。512トークンの出力を5回実行し、中央値を集計した。共有前綴やホットドキュメントの再利用テストでも、P2P有効環境の方が安定した数値を記録した。

環境依存性と今後の更新予定

実測値はテスト中に他のリクエスト負荷が存在したため、環境によって変動する可能性がある。8路並列時の最適化効果が横ばいになる点も、ハードウェア構成に依存する環境特性とみられる。リポジトリには通信診断ツールやベンチマークスクリプトが含まれており、ユーザーが自前のPC環境で再現しやすいよう設計されている。APIのデフォルトポートは8000番で、外部公開時はホストアドレスを0.0.0.0に変更する必要がある。

A40カードを搭載した環境では再起動後に旧ワーカーの退出を待ってから新エンジンを起動する手順が推奨されている。各セクションのドキュメントにはCUDA graphの最適化手法や通信経路の仕組みが記載されており、トラブルシューティングに役立つ。結果は2026年10月以降もGitHubのresultsディレクトリに逐次更新される予定だ。

出典