2台のDGX SparkでTP=2 LLM推論を運用するオープンソースクラスターツール
25秒でわかる内容解説
GitHubユーザーzhuorudanが、2台のNVIDIA DGX Sparkを接続して大規模言語モデルを推論するクラスター運用ツールを公開した。個人宅のネットワーク環境から本番運用に近い管理を実現する。ワンコマンドでのモデル切替や、Difyのワークフローエージェントを動かすプロトコル変換機能を搭載している。自作PCでLLMを動かす技術者にとって、ハードウェアの限界を最大化する実用的な選択肢になる。
2台のDGX SparkでTP=2推論を並列実行する運用ツール
2026年10月4日に公開されたGitHubプロジェクトは、2台のDGX Sparkを1つのクラスターとして運用する。各機はGB10プロセッサーと128GBの統一メモリを搭載し、合計で244GBのメモリ容量を確保する。テキスト生成モデルの推論において、Tensor Parallelism(TP)という並列処理方式でTP=2を設定する。これにより、1台では収まらない大規模モデルを2台で分割して実行できる。
運用の核となるのはCLIツールだ。モデルの登録、ダウンロード、切替、ヘルスチェックをスクリプト1つで完結させる。モデル切替には約2分から10分を要し、健康チェックの完了待ちを含む。ダウンロード時は2台のノードにモデルの断片を自動で分散させ、200GのCX7ファブリック経由で同期する。転送速度は秒速約1.8GBと記録されている。
クライアント側からはOpenAI互換の統一エンドポイントに接続するだけだ。モデルを切り替えてもクライアントの設定変更は不要になる。Webベースの運用パネルも標準で同梱され、依存パッケージなしでモデルのライフサイクル管理やタスクログを確認できる。
Home-labから本番環境へつなぐ自動復旧とプロトコル変換
2台のDGX Sparkを家庭ネットワークで繋ぐと、200GのCX7直接リンクと各240Wの消費電力という強力な環境が整う。しかし既存のクラウド用ツールは、ローカル環境の複雑な接続を前提としていない。このプロジェクトは、その隙間を埋める接着剤のような存在として開発された。
最大の課題はノード間の同期と障害復旧だ。従来の構成では、ヘッドノードが終了してワーカーノードが応答待ちになると、NCCL mismatch(通信プロトコルの不一致)でペアが50分間固まることがあった。このツールには2分間の死活監視を行うウォッチドッグが組み込まれている。異常を検知すると、ワーカーからヘッドの順に両ノードを自動再構築する。1時間あたりの復旧試行は4回で制限し、クラッシュ後のログは7日間保持する。
プロトコル面では、Difyワークフローエージェントの互換性も重視された。最新のvLLMは古いfunctions形式のAPIを廃止したが、これによりDifyのツール呼び出しが静かに壊れていた。このツールはvLLM本体を改修せず、前後にプロトコルシムを挟むことで双方向の変換を実現した。クライアントは常にdsparkというモデル名で接続し続けられる。
実測された推論速度と対応モデルの一覧
公開されたレシピでは、複数の大規模モデルのベンチマーク値が記録されている。GLM-5.3-Flash W4A16(320B-A18B MoE)は、1Mコンテキスト長に対応し、6並列環境で秒間65〜68トークンの推論速度を記録した。DeepSeek-V4-Flash(156GB bf16)は秒間約33トークン、Qwen3.8-27B NVFP4は低遅延で262kコンテキスト長を実現する。
MiniMax-M2.7 NVFP4やVisionモデルのレシピも同梱されている。
開発者は個人の2台構成クラスターで実際に運用し、テストを重ねている。NVIDIA公式の製品やサポート対象ではないため、個人レベルのローカルAI愛好家向けに最適化されている。ネットワークは双方向100G RoCEリンク(MTU 9000のジャボンフレーム対応)を2本張り、200Gの帯域を確保している。
開発者はこの構成を「奇妙に強力なもの」と表現する。 家庭のLAN環境でありながら、244GBの統一メモリと200Gのファブリックリンクを共有できる点が特徴だ。消費電力は各240Wに抑えられており、電力事情を気にするローカル環境でも継続的な運用が可能になる。
Two Sparks on a home network is a weirdly powerful thing: 244 GB unified memory, 200G CX7 direct links, 240 W each.
家庭のネットワークにDGX Sparkを2台繋ぐと、奇妙に強力な環境が整う。244GBの統一メモリと200GのCX7直接リンク、各240Wの消費電力だ。
中国語ドキュメントの整備と今後の運用見通し
公開当初から中国語の展開ドキュメントが用意されている。CX7のネットワーク設定、ジャボンフレームの検証、Hugging Faceのモデル断片分割、ファブリック同期、frpによる公開まで、再現可能な手順が記載されている。モデル別のベンチマークや制約事項も個別のドキュメントで追跡されている。
今後の展開として、レシピの追加やパッチ適用が予定されている。MITライセンスのもとで公開されており、コミュニティによる改良や独自モデルの登録が進む見込みだ。NVIDIA公式のサポートは付かないが、個人用DGX Sparkクラスターの運用標準ツールとして定着する可能性がある。
2026年10月4日に公開されたこのプロジェクトは、ローカル環境で大規模LLMを安定運用する新しい基準を示した。技術者が自作ハードウェアで推論速度とメモリ容量を最大化する際、実証済みの構成として参照されるだろう。