· ローカルAI

単体RTX 3090と64GB RAMでQwen3.8-Flash-Nextを動作させるローカルAIランタイムの公開

25秒でわかる内容解説

2026年9月30日、DominikBuckoが単体のRTX 3090と64GB RAMでQwen3.8-Flash-Nextを動かすランタイム「qwen38-flash-next-3090」を公開した。125GBのモデル重みをGPUとCPUで分割し、最大128Kトークンの長文コンテキストを維持する。一般的なローカルAI環境で高速な推論が可能になるため、自作PC愛好家の選択肢が広がる。

GPUとCPUの分割計算で128Kコンテキストを実現

本ランタイムはvLLM(高速推論エンジン)を基盤とし、GPU上のホットエキスパートとCPU/RAM上のコールドエキスパートを組み合わせる。125GBのチェックポイントはカードのメモリ容量の約5倍に達するが、注意機構と密な重み、各層の32個のホットエキスパートをGPUに常駐させる。残りのコールドエキスパートは推論中にCPUがRAMから直接計算する。

The checkpoint (INT4 experts, FP8 embedding table) is 125 GB, about five times the card's memory.

チェックポイントは125GBであり、カードのメモリ容量の約5倍に相当する。

入力プロンプトの処理段階であるprefill(プロンプト処理)では、すべてのエキスパートをGPUへストリーミングするため長時間のテキストでも高速に処理できる。131Kトークンのプロンプトに対し、最初のトークン生成まで62秒、最大2,106 tok/sの速度を記録した。推論にはMTP分岐推論(複数トークンを並列生成する手法)を採用し、1ステップで3トークンを生成する。

一方、文章生成段階のdecode(トークン生成)はRAM帯域幅に依存する。INT8 KVキャッシュ(8bit量化された履歴記憶領域)を採用することで、最大141,504トークンのコンテキストをGPUメモリ内に収められる。131Kプロンプトの生成では47.4 tok/sの速度を示した。

GPUは待機中にPCIe経由で約22%のコールドエキスパートを計算する。v1エンドポイントでOpenAI形式のAPIを提供する。

Linux環境とNVMe SSDが推論速度を左右する

動作にはLinux環境とDocker、NVIDIAコンテナツールキットが必須である。NVIDIAドライバーは580以降が必要で、AVX2対応のx86-64 CPUを搭載するPCが対象となる。

動作環境の要件一覧
項目値
OSLinux
ドライバー580以降
CPUAVX2対応x86-64
RAM64GB
ストレージNVMe SSD 約130GB

ディスクには約130GBの空き容量を持つNVMe SSD(不揮発性メモリ専用の高速転送規格)が推奨される。チェックポイントの読み込みはサービス提供中でも行われるため、高速なストレージが起動時間や読み込み速度に影響する。CPUコア数やメモリの仕様によって性能が変動する。

32コアのCPUでは最大51 tok/sのdecode速度を得られるが、16コアでは47 tok/s、8コアでは36 tok/sに低下する。デスクトップ向けのZen 4以降のCPUやDDR5メモリを搭載した環境では、コアあたりの帯域幅が広く、さらに高速化する可能性がある。コンテナはインストールされたRAMから8GiBを引いた容量を割り当て、huge pagesでメモリ領域を確保する。

NVMeにはFP8の層別埋め込みテーブル51GBと3,560個のleast-used expertsが配置される。

コア数による速度差とINT8キャッシュの精度検証

GitHub公開直後のコミュニティからは、単体GPUでの大規模モデル動作に対する検証結果が注目されている。同一チェックポイントとvLLMビルドを基盤とする2枚組みのRTX 3090環境では、prefillが3,410 tok/s、decodeが84 tok/sに達する。

下のグラフは、異なるCPUコア数における131Kプロンプトの処理速度を示している。prefillはNVMeとGPUの並列処理で2,100 tok/s前後を維持するが、一部のリクエストでは約1,450 tok/sの低速パスが実行される。

Decode depends mainly on RAM bandwidth, because the CPU computes the cold experts.

CPUがコールドエキスパートを計算するため、推論速度は主にRAM帯域幅に依存する。

INT8 KVキャッシュの精度はgreedy-decoding(貪欲法による最確候補生成)の一致のみで確認済みであり、ベンチマークスイートとの比較は未実施である。また、デスクトップCPUや他24GB GPUでの動作検証も進行中だ。python3 scripts/smoke_test.pyで動作確認できる。make benchコマンドで4K、8K、32K、131Kの異なる長さのプロンプトをまとめてテストできる。

カーネルコンパイルと未検証環境のデータ公開予定

現時点では一度に一つのリクエストしか処理できず、他のリクエストはキューに溜まる。最大135,168トークンまで対応可能だが、GPUメモリが逼迫した場合はホットエキスパート数を32から28に減らして調整できる。最初の起動時はGPUカーネルのコンパイルに時間を要し、新しい長文プロンプト入力後の約64ステップはRAMアレーナの適応で低速になる。

INT8 KVキャッシュの精度評価はgreedy-decodingの一致のみで確認済みであり、ベンチマークスイート比較は未実施である。

2026年10月以降、デスクトップCPUおよび他24GB GPUでの動作検証データがGitHub上で公開される予定だ。ユーザーは独自環境でのprefillとdecode速度を報告できるようになっている。RELEASE notesではv0.1.0以降のイメージdigestがリストされる。

用語の注釈

prefill
入力プロンプトをまとめて処理し、最初の出力トークンを生成する段階である。(参考:LLM分散推論サービス入門ガイド ~分散LLM推論基盤を構築 ...)
NVMe
不揮発性メモリ(SSD)専用の高速データ転送プロトコル。PCIe接続により読み書き速度を大幅に向上させる。(参考:メモリ基本講座「NVMe とは何ぞや」|TECHブログ ...)

出典