· ローカルAI

RTX 2080 Ti 22GB向けQwen3.8-27Bの256Kコンテキストデプロイレシピ

25秒でわかる内容解説

GitHubユーザーhowawuが2018年製Turing GPUであるRTX 2080 Ti 22GB向けに、27BパラメータのQwen3.8モデルを動作させるレシピを公開した。1.9BのドラフターとKVMem技術の組み合わせにより、256Kの論理コンテキストと45から48 tok/sの対話速度を両立している。古いグラフィックカードで最新のハイブリッドモデルをローカル展開したい技術者にとって、実用的な構成例となる。

256K論理コンテキストと67 tok/sを片側カードに収める

2026年9月21日に公開されたこのレシピは、27BのQwen3.8モデルと1.9BのDFlash2ドラフターを単一GPUで駆動する。Q2量子化を採用した混合精度モデルは、Q4_K_M相当の品質を維持しつつ22GBのVRAMに収まっている。KVMemという技術が11万2640トークンの物理作業セットを管理し、古いコンテキストブロックを必要に応じて取得する。これにより256Kの論理コンテキストを表現可能にした。

The 256K claim is a logical context capacity, not 256K tokens of fully resident target KV.

256Kの主張は、完全にGPUに常駐する256KトークンのKV容量ではなく、論理コンテキストの容量を指す。

日常の対話では45から48 tok/sの速度が記録され、単純なコード生成テストでは中央値66.92 tok/sを記録した。推論エンジンはllama.cppとKVMemの二種類から選べる。両方を同一ポートで動作させることで、クライアントやIDE統合を切り替えずに使い分けられる。

2つの起動モードの比較
モードコンテキストエンジン
A131,072upstream llama.cpp + DFlash2
B262,144 (logical)KVMem

モードはコンテキスト容量とエンジンで明確に二分されている。Aモードは128Kの固定コンテキストで低遅延を重視し、Bモードは256Kの論理コンテキストで長文処理に特化する。VRAMの割り当ては厳密に設計され、ターゲットモデルの重み12.11GB、ドラフター1.06GB、KVキャッシュ3.65GBと2.60GBで構成される。VRAMの0.8 GiB以上がヘッドルームとして確保される。

DFlash2とn-gram再利用による二重スペキュレーション

速度向上の核となるのは、二つのスペキュラティブデコーディングパスの組み合わせである。DFlash2は新しいテキストの生成を担い、n-gram-modはコードやテンプレートの反復を検出する。暖状態でのn-gram再利用では、同じコードリクエストの速度が70.39から227.65 tok/sへ3.23倍に跳ね上がった。ターゲットモデルは候補を検証するため、「無料」とはニューラルドラフトパスがないことを意味し、GPU作業がないわけではない。

reasoning-effort=lowにより、EfficientThinkとSimPOの組み合わせがモデルの冗長な推論を抑制する。GGML_MMVQ_MAX=4とGGML_MMVQ_ALL=1の環境変数が適用され、Turingアーキテクチャ向けのMMVQからMMQへのルーティング切り替えも、MATLAB作業負荷で35.72から44.87 tok/sへ改善した。

11Kトークンの続き文章を生成する際、チェックポイント修正により事前生成の待ち時間が21.7秒から0.356秒へ短縮され、61倍の高速化を実現した。

測定条件と品質評価の明確な線引き

レポジトリのドキュメントは、測定値の解釈境界を明確にしている。Q4_K_M相当の品質は演算者による主観評価であり、perplexityの等価性を主張するものではない。KVMemによる長文コンテキスト取得では、正確なフル履歴アテンションとGPU作業セットの上限をトレードオフしている。

速度はスペキュラティブ受容率に応じて変動する。n-gramの高速化効果はプロンプトを反復した場合に限定され、独立した冷たいプロンプトでベンチマークすると数値は下がる。11Kトークンの続き文章を生成する際、チェックポイント修正により事前生成の待ち時間が21.7秒から0.356秒へ短縮され、61倍の高速化を実現した。

詳細な起動フラグと環境変数はLAUNCH_PARAMS.mdに十一個のよくある失敗例と共に記載されている。温度0.7、top-k 20、top-p 0.8の組み合わせで推論が安定する。

Windows 11環境への最適化と今後の展開

検証環境はWindows 11に限定され、PowerShellスクリプトで起動と停止を管理する。llama.cppの16378d9コミットとTuringルーティングパッチ、KVMem向けにビルドされた75-real互換サーバーが必要となる。モデルファイルはnerkyorが提供するQ2-LynnStyleディレクトリからダウンロードし、froggericのチャットテンプレートv22と組み合わせる。

今後はKVMem本体のライセンス決定と、マルチモーダル対応の安定化が予定されている。画像生成プロジェクトでも同様のTuringカード活用が進んでおり、ローカルAI界隈では22GBモデルの最適化が継続している。公式ドキュメントの更新は2026年9月下旬に続き、新しいベンチマークデータが追加される見込みである。

出典