· ローカルAI

autotrustが公開したVision対応決断モデルJEV-27B-VLの仕組み

25秒でわかる内容解説

autotrustは2026年10月1日から3日にかけて、Vision対応の決断モデル「JEV-27B-VL」を公開した。基盤はQwen3.8-27Bであり、Apache 2.0ライセンスでウェイトが配布されている。テキストと画像を入力でき、高速な確率決断と思考付き推論の二つのモードを備える。ローカル環境でエージェントやレコメンデーションを動かす技術者にとって、単一フォワードパスで複数の選択肢を評価できる点が実用性が高い。

Qwen3.8-27Bを基盤とした双軸のモデル設計

autotrustは2026年10月1日から3日にかけて、Vision対応の決断モデル「JEV-27B-VL」を公開した。基盤はQwen3.8-27Bであり、Apache 2.0ライセンスでウェイトが配布されている。テキストと画像を入力でき、高速な確率決断と思考付き推論の二つのモードを備える。ローカル環境でエージェントやレコメンデーションを動かす技術者にとって、単一フォワードパスで複数の選択肢を評価できる点が実用性が高い。

System 1はテキストと画像の両方に対応し、最大256Kトークンのコンテキスト長を処理できる。POST /v1/decideエンドポイントでは、2から256の選択肢を一度に指定できる。選択肢が16を超えるとラベルが拡張されるが、再学習は不要である。確率出力はキャリブレーションされており、信頼度と実際の正解率が一致しやすい。

System 2はQwen3.8-27Bそのものを動かす思考付き推論モードだ。画像入力に対応し、ステップバイステップの思考過程を記述できる。HumanEval pass@1は78.0%を記録し、基盤モデルの性能を完全に維持している。

vLLMの`serve.sh`スクリプトを実行すれば、標準的なOpenAI互換サーバーとして起動できる。`--enable-lora`フラグでLoRAアダプターを読み込み、画像はプロンプト内に最大8枚まで埋め込める。

単一パスで評価する決断性能とレコメンデーション

System 1は動画のサムネイルだけからユーザーの視聴確率を算出できる。 MicroLens-100kデータセットでの評価では、AUCが0.727を記録した。これは5万9045人の視聴履歴で学習した協調フィルタリングと同等の数値であり、新規動画のアップロード直後から推薦が可能である。

JEV only needs the cover, so new videos and new creators can be recommended from the first second.

JEVはサムネイルだけ必要なので、新しい動画やクリエイターをアップロード直後から推薦できる。

画像認識による決断は、単一のフォワードパスで完了するため、制御ループ内でのリアルタイム処理に適している。ロボットアームの制御では約240ミリ秒で判断を返し、20件のランダムなシーンで75%を完了した。コンピュータ使用では60件のランダムなマルチステップタスクの95%を完了した。

下の図では、エージェントの計画やエラー回復の軌跡を比較するベンチマークで、System 1が73.2%の精度を記録している。 GPT-5やGemini-3-Flashなどの主要モデルを上回り、論文の表中で最高位となった。

Plan-RewardBench
Plan-RewardBenchベンチマークにおける主要モデルとの比較図(出典:Hugging Face trending)

AgentRewardBenchでは、1,302件の実務トラジェクトリーに対して、すべてのジャッジモデルより高Precisionを達成した。 各ジャッジのrecallにおけるJEVのPrecision値を比較した。

AgentRewardBenchにおけるジャッジ比較
ジャッジモデルJEV-27B-VL (同recall時のPrecision)
Rule-based86.2
WebJudge (o4-mini)87.7
WebJudge-7B86.2
World-State-Model-7B77.7
GPT-4o72.9
Claude 3.7 Sonnet75.6
Qwen2.5-VL-72B67.9

VL-RewardBenchでは、2,494件の画像回答ペアを163秒で判定し、78.3%の正解率を示した。 画像回答の良し悪しを判定するMMRB2ベンチマークでも、平均63.8%のスコアを記録している。

主要ベンチマークにおける決断性能
評価ベンチマークJEV-27B-VL System 1
Plan-RewardBench73.2%
VL-RewardBench78.3%
MMRB2 平均63.8%
multimodal judge
MMRB2ベンチマークにおけるスコア比較図(出典:Hugging Face trending)

確率分布の正確性と医療分野での活用

System 1の確率分布は、TypeSafe Jev 1.13のAPIとKLダイバージェンスが約0.017と極めて近い。yes/no判定のAUROCは0.995を記録し、選択肢のトップ1一致率も95.8%に達した。

信頼度と正解率の差を示すExpected Calibration Errorは0.0009であり、出力される確率が非常に正確に補正されている。医療質問のゼロショット精度では77.8%を達成し、人間の専門家の78.0%に迫る数値を示した。

CLINC150データセットでは、選択肢を一度に判定する方がyes/noを並べるよりコストが低い。150オプション全選択肢の名のみで89.5%の精度を記録し、説明文を追加すると93.8%の性能を発揮した。

検索結果の再ランキングではnDCG@10が0.858を記録し、bge-reranker-v2-m3の0.793を上回った。ニュース推薦のゼロショットAUCも0.642を達成した。ハルシネーションガードでは96.4%の精度を示した。

動作環境と実運用における未確認点

vLLMを用いて動かすには80GB以上のVRAMを必要とする。System 2ではHumanEval pass@1が78.0%を記録し、基盤モデルの性能を維持している。

評価はシミュレーションや公開ベンチマークに基づくものであり、実サービス環境でのスケーラビリティは未確認である。長時間運用時の安定性や、80GBクラスGPU未満でのLora圧縮動作の詳細も今後の検証待ちである。

256Kトークンのコンテキスト長を活用するには、MAX_MODEL_LEN=262144を設定してサーバーを起動する必要がある。この長さでの決断精度は資料に記載されている。最大250Kトークンで20/20正解を記録しており、メモリ消費量の実測値は記載されていない。

2026年10月3日に公開されたウェイトを、80GBのGPU環境で `serve.sh`(または `serve_decide.py`)を実行すればデプロイできる。Apache 2.0ライセンスのため商用利用も制限が緩い。150個の選択肢を持つ質問を処理する際、名のみなら約1.4秒、説明文付きなら約2.6秒を要する。80GBのGPUで8リクエストを並列実行した際のベンチマーク数値である。

出典