autotrustが公開したVision対応決断モデルJEV-27B-VLの仕組み
25秒でわかる内容解説
autotrustは2026年10月1日から3日にかけて、Vision対応の決断モデル「JEV-27B-VL」を公開した。基盤はQwen3.8-27Bであり、Apache 2.0ライセンスでウェイトが配布されている。テキストと画像を入力でき、高速な確率決断と思考付き推論の二つのモードを備える。ローカル環境でエージェントやレコメンデーションを動かす技術者にとって、単一フォワードパスで複数の選択肢を評価できる点が実用性が高い。
Qwen3.8-27Bを基盤とした双軸のモデル設計
autotrustは2026年10月1日から3日にかけて、Vision対応の決断モデル「JEV-27B-VL」を公開した。基盤はQwen3.8-27Bであり、Apache 2.0ライセンスでウェイトが配布されている。テキストと画像を入力でき、高速な確率決断と思考付き推論の二つのモードを備える。ローカル環境でエージェントやレコメンデーションを動かす技術者にとって、単一フォワードパスで複数の選択肢を評価できる点が実用性が高い。
System 1はテキストと画像の両方に対応し、最大256Kトークンのコンテキスト長を処理できる。POST /v1/decideエンドポイントでは、2から256の選択肢を一度に指定できる。選択肢が16を超えるとラベルが拡張されるが、再学習は不要である。確率出力はキャリブレーションされており、信頼度と実際の正解率が一致しやすい。
System 2はQwen3.8-27Bそのものを動かす思考付き推論モードだ。画像入力に対応し、ステップバイステップの思考過程を記述できる。HumanEval pass@1は78.0%を記録し、基盤モデルの性能を完全に維持している。
vLLMの`serve.sh`スクリプトを実行すれば、標準的なOpenAI互換サーバーとして起動できる。`--enable-lora`フラグでLoRAアダプターを読み込み、画像はプロンプト内に最大8枚まで埋め込める。
単一パスで評価する決断性能とレコメンデーション
System 1は動画のサムネイルだけからユーザーの視聴確率を算出できる。 MicroLens-100kデータセットでの評価では、AUCが0.727を記録した。これは5万9045人の視聴履歴で学習した協調フィルタリングと同等の数値であり、新規動画のアップロード直後から推薦が可能である。
JEV only needs the cover, so new videos and new creators can be recommended from the first second.
JEVはサムネイルだけ必要なので、新しい動画やクリエイターをアップロード直後から推薦できる。
画像認識による決断は、単一のフォワードパスで完了するため、制御ループ内でのリアルタイム処理に適している。ロボットアームの制御では約240ミリ秒で判断を返し、20件のランダムなシーンで75%を完了した。コンピュータ使用では60件のランダムなマルチステップタスクの95%を完了した。
下の図では、エージェントの計画やエラー回復の軌跡を比較するベンチマークで、System 1が73.2%の精度を記録している。 GPT-5やGemini-3-Flashなどの主要モデルを上回り、論文の表中で最高位となった。
AgentRewardBenchでは、1,302件の実務トラジェクトリーに対して、すべてのジャッジモデルより高Precisionを達成した。 各ジャッジのrecallにおけるJEVのPrecision値を比較した。
| ジャッジモデル | JEV-27B-VL (同recall時のPrecision) |
|---|---|
| Rule-based | 86.2 |
| WebJudge (o4-mini) | 87.7 |
| WebJudge-7B | 86.2 |
| World-State-Model-7B | 77.7 |
| GPT-4o | 72.9 |
| Claude 3.7 Sonnet | 75.6 |
| Qwen2.5-VL-72B | 67.9 |
VL-RewardBenchでは、2,494件の画像回答ペアを163秒で判定し、78.3%の正解率を示した。 画像回答の良し悪しを判定するMMRB2ベンチマークでも、平均63.8%のスコアを記録している。
| 評価ベンチマーク | JEV-27B-VL System 1 |
|---|---|
| Plan-RewardBench | 73.2% |
| VL-RewardBench | 78.3% |
| MMRB2 平均 | 63.8% |
確率分布の正確性と医療分野での活用
System 1の確率分布は、TypeSafe Jev 1.13のAPIとKLダイバージェンスが約0.017と極めて近い。yes/no判定のAUROCは0.995を記録し、選択肢のトップ1一致率も95.8%に達した。
信頼度と正解率の差を示すExpected Calibration Errorは0.0009であり、出力される確率が非常に正確に補正されている。医療質問のゼロショット精度では77.8%を達成し、人間の専門家の78.0%に迫る数値を示した。
CLINC150データセットでは、選択肢を一度に判定する方がyes/noを並べるよりコストが低い。150オプション全選択肢の名のみで89.5%の精度を記録し、説明文を追加すると93.8%の性能を発揮した。
検索結果の再ランキングではnDCG@10が0.858を記録し、bge-reranker-v2-m3の0.793を上回った。ニュース推薦のゼロショットAUCも0.642を達成した。ハルシネーションガードでは96.4%の精度を示した。
動作環境と実運用における未確認点
vLLMを用いて動かすには80GB以上のVRAMを必要とする。System 2ではHumanEval pass@1が78.0%を記録し、基盤モデルの性能を維持している。
評価はシミュレーションや公開ベンチマークに基づくものであり、実サービス環境でのスケーラビリティは未確認である。長時間運用時の安定性や、80GBクラスGPU未満でのLora圧縮動作の詳細も今後の検証待ちである。
256Kトークンのコンテキスト長を活用するには、MAX_MODEL_LEN=262144を設定してサーバーを起動する必要がある。この長さでの決断精度は資料に記載されている。最大250Kトークンで20/20正解を記録しており、メモリ消費量の実測値は記載されていない。
2026年10月3日に公開されたウェイトを、80GBのGPU環境で `serve.sh`(または `serve_decide.py`)を実行すればデプロイできる。Apache 2.0ライセンスのため商用利用も制限が緩い。150個の選択肢を持つ質問を処理する際、名のみなら約1.4秒、説明文付きなら約2.6秒を要する。80GBのGPUで8リクエストを並列実行した際のベンチマーク数値である。
出典
- autotrust/JEV-27B-VL (image-text-to-text)(Hugging Face trending) · 議論