GLM-5.3とDeepSeek V4シリーズのPCIe多GPU推論最適化リポジトリ公開
20秒でわかる内容解説
2026年10月9日、GitHubユーザーzhangjk1207がPCIe接続の複数GPU環境向け推論最適化リポジトリを公開した。GLM-5.3-FlashやDeepSeek-V4シリーズを対象に、デプロイメントスクリプトや並列実測データを提供する。自前のPCで複数カードを繋ぎモデルを動かす技術者向けに、設定手順と性能改善の経緯をまとめている。
多GPU環境向け最適化スクリプトの公開
公開されたリポジトリは、GLM-5.3-Flash W4A16とDeepSeek-V4シリーズのPCIeバス(複数GPU間を繋ぐデータ伝送路)多カード推論向けに設計された。主要な最適化項目としてCUDA graph(計算処理の記録と再生機能)の範囲拡張、投機デコーディング、マルチカード通信、KVキャッシュ(プロンプトや生成結果の記憶領域)管理が挙げられる。
各モデルにはA800やA40などのGPU環境に対応したデプロイメントスクリプトが同梱されている。ユーザーはModelScopeからモデルをダウンロードし、スクリプトを実行するだけで推論サーバーを起動できる。
| 項目 | 値 |
|---|---|
| 対象モデル | GLM-5.3-Flash W4A16、DeepSeek-V4シリーズ |
| 推奨GPU | A800 80GB、A40 48GB |
| 使用フレームワーク | vLLM v0.13.1 |
| 通信プロトコル | NCCL、CustomAllreduce |
PCIeバスと通信プロトコルの最適化経緯
PCIeバスで接続された複数GPU間はNVLink(専用高速リンク)のような高速リンクを持たないため、カード間のデータ転送がボトルネックになりやすい。このリポジトリではCUDA graph機能を活用し、推論処理の計算グラフを事前に記録して再生する範囲を広げた。これにより計算のオーバーヘッドを削減できる。
またNCCL P2P(カード間の直接通信プロトコル)の状態によって初期化時の通信がブロックする場合があるため、環境に応じて無効化フラグを設定する必要がある。
KVキャッシュは過去のプロンプトや生成結果を記憶する領域で、CPUメモリに預ける設定も推奨されている。各ノードのGPU構成はSM80やSM86(GPUのアーキテクチャ世代)に合わせて最適化されたコンテナイメージが提供される。通信経路にはPIX、PXB、SYSの3種類があり、ノード内とノード間でパスが異なる。データ転送の効率化を図るため、バッチ処理時のトークン数やGPUメモリの使用割合を0.95程度に抑える設定が標準で含まれている。
並列実測データと性能改善の推移
実測データでは、モデルとGPU構成によって最適化の効果が分かれた。GLM-5.3-Flashの4カード並列テストでは、1路と2路、16路で明確な性能向上が確認された。8路の場合のみ約715 token/sでほぼ横ばいとなった。
DeepSeek-V4-FlashではCUDA graphの捕捉範囲を広げた結果、6路以上で生じていたスループットの急減が解消された。6路で約236%、8路で約211%、16路で約111%の向上を示している。
扩展图捕获范围后,6 路及以上的吞吐断崖消失。
拡張図捕捉範囲後、6路以上のスループット断崖は消失した。
DeepSeek-V4.1-Flashの8カード構成では、最大シーケンス数を4から8へ拡張しP2Pを有効にしたことで、8路の集約スループットが340.7から583.3 token/sへ改善した。TTFT(最初の応答までの待ち時間)も2.3秒台から0.7秒前後に短縮された。512トークンの出力を5回実行し、中央値を集計した。共有前綴やホットドキュメントの再利用テストでも、P2P有効環境の方が安定した数値を記録した。
環境依存性と今後の更新予定
実測値はテスト中に他のリクエスト負荷が存在したため、環境によって変動する可能性がある。8路並列時の最適化効果が横ばいになる点も、ハードウェア構成に依存する環境特性とみられる。リポジトリには通信診断ツールやベンチマークスクリプトが含まれており、ユーザーが自前のPC環境で再現しやすいよう設計されている。APIのデフォルトポートは8000番で、外部公開時はホストアドレスを0.0.0.0に変更する必要がある。
A40カードを搭載した環境では再起動後に旧ワーカーの退出を待ってから新エンジンを起動する手順が推奨されている。各セクションのドキュメントにはCUDA graphの最適化手法や通信経路の仕組みが記載されており、トラブルシューティングに役立つ。結果は2026年10月以降もGitHubのresultsディレクトリに逐次更新される予定だ。