vLLMエージェントセッション用GPUサイズ計算ツール「agent-gpu-calculator」公開
20秒でわかる内容解説
Drobiazkinが2026年9月24日、vLLM上で動作するLLMエージェントセッションのGPU数とRAM容量を算出するWebツールを公開した。ブラウザで完結しビルド不要なため、ローカル環境のハードウェア選定に直接活用できる。エージェントの待機状態やツール実行ループを考慮した設計で、実務的なリソース見積もりが容易になる。
ブラウザで完結するエージェントリソース算出
Drobiazkinは2026年9月24日、vLLM(高速推論フレームワーク)上で動作するエージェントセッション用のGPUサイズ計算ツールをGitHubに公開した。単一ファイルのHTMLで構成され、ブラウザだけで動作する。ビルドやサーバー設定が不要だ。
エージェントセッションは生成とツール実行を繰り返すループ構造を持つ。ステップ間のアイドル時にVRAMやホストRAMにKVキャッシュ(キーとバリューのキャッシュ)を保持する。ツールはターゲットとする同時実行エージェント数や1日のステップ数を指定できる。
1つのレプリカは1つのNVLink(GPU間高速接続)ドメイン内のテンソル並列(モデルを分割して並列計算)GPUで構成される。重みと共有プレフィックス、キャッシュはレプリカ内で分割される。メモリ容量とスループットの両条件を計算し、より大きい方を採用する。
デコード時は重みとキャッシュの読み取りがボトルネックになる。プレフィル時は行列計算が支配的になる。並列度はリトルの法則に従い、同時実行数とサイクル時間を掛け合わせる。
URLのハッシュにシナリオが保存され、コピーで共有できる。
対応モデルと計算モデルの内部構造
対応モデルにはQwen3シリーズやGLM-4.6、DeepSeek-V4-Flashなどが含まれる。プリセットにはcodeやenterprise documents、reasoning、chat in russianなどのロードプロファイルがある。値はHugging Faceのconfig.jsonやsafetensorsヘッダー、vLLMのソースコード、NVIDIAのdatasheetから取得される。2026年9月に検証済みだ。
内部計算モデルはMLA(圧縮Attention)やDSA(スパースAttention)に対応する。MLAは各TPランクに潜在KVキャッシュの完全コピーを保持する。DSAはtop-k選択予算と、各TPランクで完全に計算されるインデクサを使用する。推論加速のMTPやEAGLEも指定できる。
効率は仮定値に基づく。プレフィル時のピーク占有率はMoE(混合Experts)で0.25、dense(密集型)で0.45だ。有効HBM(ハイバンド幅メモリ)帯域はピークの約70%、PCIe(周辺機器接続規格)はGPUあたり約50GB/sを仮定する。混合精度チェックポイントでは、アクティブパラメータの重み付きピークが計算される。
| プラットフォーム | GPU構成 |
|---|---|
| 8×H100 | HGX / DGX |
| 8×H200 | HGX / DGX |
| 8×B100 | HGX / DGX |
| 8×B200 | HGX / DGX |
| 8×B300 | HGX / DGX |
UI機能とライセンス構成
コミュニティからのコメントはまだ付いていない。ツール自体は専門的な計算を簡素化している。画面には各フィールドにhoverすると意味や単位が表示されるインフォアイコンがある。下部には計算方法の解説が記載されている。
複数のワークロードクラスを`+ add to estimate`で集計できる。互換性のないモデルとプラットフォームのペアにはバナーが表示される。各モデルプリセットには信頼度ラベルが割り当てられている。古いURLを適用すると、欠落フィールドはデフォルト値に戻り、ページが通知する。
Tailwind CSS v3.4.17がインライン化されている。外部依存がないためGitHub Pagesなどでそのまま配信できる。ライセンスはMITだ。
測定前提と未対応機能の今後の予定
これは測定ではなくモデルだ。ハードウェア購入前に、以下の仮定値を実測値に置き換える必要がある。vLLMの起動ログやベンチマークコマンド、nvbandwidthコマンドで実測値を取得できる。データ並列Attentionやノード間パイプライン並列は未対応だ。
This is a model, not a measurement. Before buying hardware, replace the assumptions below with measurements on your stack.
これは測定ではなくモデルだ。ハードウェア購入前に、以下の仮定値を実測値に置き換える必要がある。
ディスアグリゲティッドプレフィルやRDMA(リモートダイレクトメモリアクセス)によるリモートKVティアも対象外である。SLA(サービスレベル契約)の限界付近では結果が飛びやすい。重み読み取りがSLA予算の大部分を占める場合、スループットソルバーがレジーム間でジャンプする。隣接値を確認する警告が表示される。
日本国内での正式な販売や価格情報は資料に記載されていない。実行中のvLLMバージョンに合わせて値を再確認する必要がある。