· ローカルAI

vLLMエージェントセッション用GPUサイズ計算ツール「agent-gpu-calculator」公開

20秒でわかる内容解説

Drobiazkinが2026年9月24日、vLLM上で動作するLLMエージェントセッションのGPU数とRAM容量を算出するWebツールを公開した。ブラウザで完結しビルド不要なため、ローカル環境のハードウェア選定に直接活用できる。エージェントの待機状態やツール実行ループを考慮した設計で、実務的なリソース見積もりが容易になる。

ブラウザで完結するエージェントリソース算出

Drobiazkinは2026年9月24日、vLLM(高速推論フレームワーク)上で動作するエージェントセッション用のGPUサイズ計算ツールをGitHubに公開した。単一ファイルのHTMLで構成され、ブラウザだけで動作する。ビルドやサーバー設定が不要だ。

エージェントセッションは生成とツール実行を繰り返すループ構造を持つ。ステップ間のアイドル時にVRAMやホストRAMにKVキャッシュ(キーとバリューのキャッシュ)を保持する。ツールはターゲットとする同時実行エージェント数や1日のステップ数を指定できる。

1つのレプリカは1つのNVLink(GPU間高速接続)ドメイン内のテンソル並列(モデルを分割して並列計算)GPUで構成される。重みと共有プレフィックス、キャッシュはレプリカ内で分割される。メモリ容量とスループットの両条件を計算し、より大きい方を採用する。

デコード時は重みとキャッシュの読み取りがボトルネックになる。プレフィル時は行列計算が支配的になる。並列度はリトルの法則に従い、同時実行数とサイクル時間を掛け合わせる。

URLのハッシュにシナリオが保存され、コピーで共有できる。

対応モデルと計算モデルの内部構造

対応モデルにはQwen3シリーズやGLM-4.6、DeepSeek-V4-Flashなどが含まれる。プリセットにはcodeやenterprise documents、reasoning、chat in russianなどのロードプロファイルがある。値はHugging Faceのconfig.jsonやsafetensorsヘッダー、vLLMのソースコード、NVIDIAのdatasheetから取得される。2026年9月に検証済みだ。

内部計算モデルはMLA(圧縮Attention)やDSA(スパースAttention)に対応する。MLAは各TPランクに潜在KVキャッシュの完全コピーを保持する。DSAはtop-k選択予算と、各TPランクで完全に計算されるインデクサを使用する。推論加速のMTPやEAGLEも指定できる。

効率は仮定値に基づく。プレフィル時のピーク占有率はMoE(混合Experts)で0.25、dense(密集型)で0.45だ。有効HBM(ハイバンド幅メモリ)帯域はピークの約70%、PCIe(周辺機器接続規格)はGPUあたり約50GB/sを仮定する。混合精度チェックポイントでは、アクティブパラメータの重み付きピークが計算される。

対応プラットフォームプリセット
プラットフォームGPU構成
8×H100HGX / DGX
8×H200HGX / DGX
8×B100HGX / DGX
8×B200HGX / DGX
8×B300HGX / DGX

UI機能とライセンス構成

コミュニティからのコメントはまだ付いていない。ツール自体は専門的な計算を簡素化している。画面には各フィールドにhoverすると意味や単位が表示されるインフォアイコンがある。下部には計算方法の解説が記載されている。

複数のワークロードクラスを`+ add to estimate`で集計できる。互換性のないモデルとプラットフォームのペアにはバナーが表示される。各モデルプリセットには信頼度ラベルが割り当てられている。古いURLを適用すると、欠落フィールドはデフォルト値に戻り、ページが通知する。

Tailwind CSS v3.4.17がインライン化されている。外部依存がないためGitHub Pagesなどでそのまま配信できる。ライセンスはMITだ。

測定前提と未対応機能の今後の予定

これは測定ではなくモデルだ。ハードウェア購入前に、以下の仮定値を実測値に置き換える必要がある。vLLMの起動ログやベンチマークコマンド、nvbandwidthコマンドで実測値を取得できる。データ並列Attentionやノード間パイプライン並列は未対応だ。

This is a model, not a measurement. Before buying hardware, replace the assumptions below with measurements on your stack.

これは測定ではなくモデルだ。ハードウェア購入前に、以下の仮定値を実測値に置き換える必要がある。

ディスアグリゲティッドプレフィルやRDMA(リモートダイレクトメモリアクセス)によるリモートKVティアも対象外である。SLA(サービスレベル契約)の限界付近では結果が飛びやすい。重み読み取りがSLA予算の大部分を占める場合、スループットソルバーがレジーム間でジャンプする。隣接値を確認する警告が表示される。

日本国内での正式な販売や価格情報は資料に記載されていない。実行中のvLLMバージョンに合わせて値を再確認する必要がある。

出典