Jevスタイル確率推論ラッパーをLLMとビジョンモデルに適用する技術
20秒でわかる内容解説
技術ブログ著者が2026年9月26日、単一トークンの生成と対数確率パラメータを組み合わせたラッパー関数を公開した。この手法は選択肢ごとの確率を取得でき、カメラ画像の分析にも対応する。ローカル環境で動作するモデルを自作スクリプトで拡張できるため、PCでLLMや画像生成モデルを動かす技術者にとって実用的な応用方法となる。
単一トークン生成と確率取得の仕組み
基本となるプロンプトには選択肢を[A]から[D]まで並べる。APIリクエストにはmax_completion_tokensとlogprobsパラメータを追加する。これによりモデルは最良の選択肢の文字とその対数確率を返す。
複数質問を並べると、各質問ごとに確率分布が取得できる。入力処理は共有状態のプレフィックスでKVキャッシュが効くため高速化される。スクリプトはOpenCVでウェブカメラのフレームを取得し、base64形式のJPEGに変換する。
画像パスまたはデータURLをattachmentsフィールドに渡すだけで視覚モデルに送信できる。確率の正規化では、返された選択肢の対数確率から最大値を引く。欠落した選択肢はゼロまたは微小値として処理される。
未定義トークンの出力時も閾値を超えるか確認する。この処理により選択肢ごとの重みが算出される。llama.cppとOpenAIのAPI仕様差を吸収するPythonスクリプトが公開された。
llama.cppはChat Completionsエンドポイントを利用し、OpenAIはResponsesエンドポイントを使う。両者を統一的なインターフェースで扱えるため、ローカル推論サーバーとクラウドAPIの切り替えが容易になる。
llama.cppでは温度パラメータを0に、OpenAIではtop_pを1に設定し、選択肢の刈り込みを防ぐ。
Jevの登場と自己ホスト可能プロジェクト
JevはTypeSafe AI開発の分類判定特化AIで、確率推論ラッパーを用いて構造化出力を行うアーキテクチャだ。2026年9月頃、OpenJevやSemIfといった自己ホスト可能プロジェクトが出現した。これらのプロジェクトに触れた著者は、LLMのトークン確率を読み取る手法の応用に注目した。
従来のLLMは自由なテキスト生成が主流だった。確率推論ラッパーは選択肢を限定し、モデルの内部確率を直接取り出すことで判断精度を高める。このアプローチは構文解析ベースの推論と類似しているが、プロンプトの柔軟性とキャッシュの活用で異なる利点を持つ。
著者の実装では、状態記述と質問リストをJSON形式で定義する。各質問はchoiceやnoul、scoreなどのタイプに分かれ、criteriaフィールドで選択肢や基準を設定する。スクリプトがこれらの形式を自動的に文字オプションに変換し、APIリクエストを構築する。
視覚モデルへの対応はJevの公式ドキュメントではテキストとJSONのみを記載していた。著者はattachmentsフィールドを独自に追加し、カメラフレームの送信を実現した。これによりテキストだけでなく画像認識タスクにも同様の確率推論を適用できる。
プロンプトの構成はStateとQuestionを明確に分け、選択肢をリスト形式で記載する。モデルはAnswer with the letter of the best option only.という指示に従って1文字のみを生成する。この制約により不要なトークンの生成コストが削減され、処理速度が向上する。
ベンチマーク結果とコミュニティの反応
RTX 3090上でGemma 4 12BをQ4_0量化しllama.cppで動作させた結果、1フレームあたり3つの質問で約1FPSを達成した。OpenAIのgpt-6-lunaでは約0.2FPSだった。接続コストが原因と推測され、各質問ごとに別接続を張ったことが影響している。
Hacker NewsではJevのAPI的優位性が議論された。構文ベースのデコーディングと比較され、Jevはキャッシュを活用した軽量な実装と指摘される。Fireworks AIのグラマーサポートがさらなる高速化を期待させる声もあった。
Presumably this is much less good than Jev, because the normal LLM models have been trained with RLHF and to be agents.
通常のLLMモデルはRLHFでエージェントとして訓練されており、Jevより劣る可能性がある。
The hype is insufferable.
喧伝しすぎている。
一方で通常のRLHF訓練モデルでは早期レイヤーで決定するため、本手法より精度が劣る可能性が示された。Jev独自のRLCDが確率精度に与える影響は未確定だ。実環境でのTail latencyや未定義トークン出力時の確率補正方法は実装依存で検証が必要とされる。
コミュニティはリアルタイム性への期待を示し、音声終了判定などの用途でJevが優位だと評価した。ただし選択肢にないトークンが出力された場合の挙動や、補正方法の実装依存性も指摘されている。全体として実用性は高いが、過剰な喧伝には注意が必要だと結ばれている。
ローカル環境での適用と今後の展開
ローカル環境での実用化にはGPUメモリと推論速度のバランスが鍵になる。Gemma 4 12Bのモデルファイルは約7GB、マルチモーダルプロジェクタは約175MBだ。Linux環境にNVIDIAドライバー、curl、zstd、uvをインストールすれば動作する。
2026年9月26日に公開されたスクリプトは、OpenCVとurllibのみで構成される。依存パッケージが最小限のため、RTX 3090を搭載するPCで手軽に試せる。日本語プロンプトや選択肢の追加もJSON定義だけで対応可能だ。
スクリプトはバックグラウンドでフレームを評価し、ターミナルに時刻と確率パーセンテージを並べて表示する。下の画像はウェブカメラプレビュー画面とターミナル出力を示している。 並列処理により連続的な映像解析が可能になる。
今後の展開では、構造化出力の標準化とAPI互換性の向上が進む見込みだ。llama.cppとOpenAIの仕様の吸収は、ローカル推論サーバーの普及に伴いより重要になる。2026年9月27日時点でコミュニティは実環境でのレイテンシ測定を次なる課題としている。
用語の注釈
- Jev
- TypeSafe AI開発の分類判定特化AI。確率推論ラッパーで構造化出力や判断を行い、LLMより高速に動作するアーキテクチャ。(参考:Jevとは?使い方・料金・性能をGPTとClaudeと比較|SE向けに ...)