単体RTX 3090と64GB RAMでQwen3.8-Flash-Nextを動作させるローカルAIランタイムの公開
25秒でわかる内容解説
2026年9月30日、DominikBuckoが単体のRTX 3090と64GB RAMでQwen3.8-Flash-Nextを動かすランタイム「qwen38-flash-next-3090」を公開した。125GBのモデル重みをGPUとCPUで分割し、最大128Kトークンの長文コンテキストを維持する。一般的なローカルAI環境で高速な推論が可能になるため、自作PC愛好家の選択肢が広がる。
GPUとCPUの分割計算で128Kコンテキストを実現
本ランタイムはvLLM(高速推論エンジン)を基盤とし、GPU上のホットエキスパートとCPU/RAM上のコールドエキスパートを組み合わせる。125GBのチェックポイントはカードのメモリ容量の約5倍に達するが、注意機構と密な重み、各層の32個のホットエキスパートをGPUに常駐させる。残りのコールドエキスパートは推論中にCPUがRAMから直接計算する。
The checkpoint (INT4 experts, FP8 embedding table) is 125 GB, about five times the card's memory.
チェックポイントは125GBであり、カードのメモリ容量の約5倍に相当する。
入力プロンプトの処理段階であるprefill(プロンプト処理)では、すべてのエキスパートをGPUへストリーミングするため長時間のテキストでも高速に処理できる。131Kトークンのプロンプトに対し、最初のトークン生成まで62秒、最大2,106 tok/sの速度を記録した。推論にはMTP分岐推論(複数トークンを並列生成する手法)を採用し、1ステップで3トークンを生成する。
一方、文章生成段階のdecode(トークン生成)はRAM帯域幅に依存する。INT8 KVキャッシュ(8bit量化された履歴記憶領域)を採用することで、最大141,504トークンのコンテキストをGPUメモリ内に収められる。131Kプロンプトの生成では47.4 tok/sの速度を示した。
GPUは待機中にPCIe経由で約22%のコールドエキスパートを計算する。v1エンドポイントでOpenAI形式のAPIを提供する。
Linux環境とNVMe SSDが推論速度を左右する
動作にはLinux環境とDocker、NVIDIAコンテナツールキットが必須である。NVIDIAドライバーは580以降が必要で、AVX2対応のx86-64 CPUを搭載するPCが対象となる。
| 項目 | 値 |
|---|---|
| OS | Linux |
| ドライバー | 580以降 |
| CPU | AVX2対応x86-64 |
| RAM | 64GB |
| ストレージ | NVMe SSD 約130GB |
ディスクには約130GBの空き容量を持つNVMe SSD(不揮発性メモリ専用の高速転送規格)が推奨される。チェックポイントの読み込みはサービス提供中でも行われるため、高速なストレージが起動時間や読み込み速度に影響する。CPUコア数やメモリの仕様によって性能が変動する。
32コアのCPUでは最大51 tok/sのdecode速度を得られるが、16コアでは47 tok/s、8コアでは36 tok/sに低下する。デスクトップ向けのZen 4以降のCPUやDDR5メモリを搭載した環境では、コアあたりの帯域幅が広く、さらに高速化する可能性がある。コンテナはインストールされたRAMから8GiBを引いた容量を割り当て、huge pagesでメモリ領域を確保する。
NVMeにはFP8の層別埋め込みテーブル51GBと3,560個のleast-used expertsが配置される。
コア数による速度差とINT8キャッシュの精度検証
GitHub公開直後のコミュニティからは、単体GPUでの大規模モデル動作に対する検証結果が注目されている。同一チェックポイントとvLLMビルドを基盤とする2枚組みのRTX 3090環境では、prefillが3,410 tok/s、decodeが84 tok/sに達する。
下のグラフは、異なるCPUコア数における131Kプロンプトの処理速度を示している。prefillはNVMeとGPUの並列処理で2,100 tok/s前後を維持するが、一部のリクエストでは約1,450 tok/sの低速パスが実行される。
Decode depends mainly on RAM bandwidth, because the CPU computes the cold experts.
CPUがコールドエキスパートを計算するため、推論速度は主にRAM帯域幅に依存する。
INT8 KVキャッシュの精度はgreedy-decoding(貪欲法による最確候補生成)の一致のみで確認済みであり、ベンチマークスイートとの比較は未実施である。また、デスクトップCPUや他24GB GPUでの動作検証も進行中だ。python3 scripts/smoke_test.pyで動作確認できる。make benchコマンドで4K、8K、32K、131Kの異なる長さのプロンプトをまとめてテストできる。
カーネルコンパイルと未検証環境のデータ公開予定
現時点では一度に一つのリクエストしか処理できず、他のリクエストはキューに溜まる。最大135,168トークンまで対応可能だが、GPUメモリが逼迫した場合はホットエキスパート数を32から28に減らして調整できる。最初の起動時はGPUカーネルのコンパイルに時間を要し、新しい長文プロンプト入力後の約64ステップはRAMアレーナの適応で低速になる。
INT8 KVキャッシュの精度評価はgreedy-decodingの一致のみで確認済みであり、ベンチマークスイート比較は未実施である。
2026年10月以降、デスクトップCPUおよび他24GB GPUでの動作検証データがGitHub上で公開される予定だ。ユーザーは独自環境でのprefillとdecode速度を報告できるようになっている。RELEASE notesではv0.1.0以降のイメージdigestがリストされる。
用語の注釈
- prefill
- 入力プロンプトをまとめて処理し、最初の出力トークンを生成する段階である。(参考:LLM分散推論サービス入門ガイド ~分散LLM推論基盤を構築 ...)
- NVMe
- 不揮発性メモリ(SSD)専用の高速データ転送プロトコル。PCIe接続により読み書き速度を大幅に向上させる。(参考:メモリ基本講座「NVMe とは何ぞや」|TECHブログ ...)