· ローカルAI

Contrastive-LMが公開するローカル推論用スコアリングモデルCLM-v0.1-8Bの特性

25秒でわかる内容解説

対照学習で状態と行動の関連性を学習したCLM-v0.1-8Bが公開された。Qwen3-8Bを基盤に二つの軽量化ヘッドを搭載し、与えられた候補の相対スコアリングを行う。生成処理がなくエンコーダーを固定するため、ローカルPCでのエージェント検証や候補ランク付けが最大9分の1のレイテンシで実現する。技術者の自作パイプラインに組み込みやすい設計で、10月初旬にマルチモーダル版も登場する。

System One型スコアリングモデルの仕組み

Contrastive-LMが公開したCLM-v0.1-8Bは、System One型モデルと呼ばれる新カテゴリに属する。System Oneは直感的な素速さで意思決定を行う人間の認知プロセスを指す。このモデルはQwen3-8Bを基盤エンコーダーとして凍結し、その上に状態ヘッドと行動ヘッドの二つの軽量化プロジェクションヘッドを接続する。

InfoNCE loss(対照学習で用いられる損失関数)を用いて、状態と行動の類似度を最大化するよう訓練されている。

pre-trained on ~60M Nemotron Q&A pairs, mid-trained on ~30M synthetic hard negatives, post-trained on ~1M agentic trajectories.

約60MのNemotron Q&Aペアで事前学習し、約30Mの合成ハードネガティブで中期学習、約1Mのエージェント軌跡で後期学習を行う。

生成機能を持たない点が特徴だ。テキストやコードの候補を与えると、それらの相対的な確率分布を出力する。この設計により、トークンを逐次生成する従来のLLMと異なり、推論時の計算負荷を大幅に削減できる。vLLMでプーリングモードを起動するだけで埋め込みサーバーが構築できる。ポート8090でQwen3-8Bの埋め込みを配信し、別プロセスでclm-serveを実行するとAPIとWebプレイグラウンドが同時に起動する。

埋め込みの読み込み先は~/.cache/clm/に自動保存される。Pythonのclmパッケージをインストールすれば、CLMClientやEngineクラスを使って即座に推論パイプラインを組める。状態を入力して緊急度や分類確率を算出するだけでなく、自由形式の候補リストに対して相対的なランク付けも実行可能だ。

学習データとベンチマーク性能の推移

約60MのNemotron Q&Aペアで事前学習を行い、約30Mの合成ハードネガティブで中期学習、約1Mのエージェント軌跡で後期学習を重ねた。

CLM-v0.1-8Bの学習フェーズとデータ量
学習フェーズデータ量
事前学習約60M
中期学習約30M
後期学習約1M

この段階的な学習プロセスにより、ゼロショット状態でコンピュータ操作やゲームプレイ、ツール呼び出しにおいてJevと同等の性能を維持しつつ、レイテンシを最大9分の1に低減させた。検証用ヘッドをファインチューニングすると、DeepSWEで81.6%、Terminal-Bench 2.1で87.6%の精度を記録する。これらはJevより4〜6倍高速な結果だ。

状態と行動を別々にエンコードするキャッシュ機構を採用している。約1kの候補に対してアクション埋め込みを再利用するため、Jevより13倍高速に動作する。ファインチューニングはヘッドのみを対象とするため、git cloneとpip installでリポジトリを準備し、clm-downloadコマンドで初期チェックポイントを指定するだけで済む。バッチサイズ512で学習を進めることで、ローカルPCでも低コストに検証ヘッドを微調整できる。

ローカル環境での適用例と制限事項

Hugging Face trendingに掲載され、技術コミュニティから注目されている。contrastive-lmパッケージでAPIを構築するだけで運用可能だ。写真では左側に入力状態と質問、右側に回答確率が表示される。

The CLM playground: a state with three typed questions on the left, their answer distributions on the right
CLMプレイグラウンドの画面。左側に入力状態と質問、右側に回答確率が表示される。(出典:Hugging Face trending)

プレイグラウンドでは、左側に入力状態と質問項目を配置し、右側に回答確率の分布を即座に表示する。状態を入力して緊急度や分類確率を算出するだけでなく、自由形式の候補リストに対して相対的なランク付けも実行可能だ。ただし、ベースモデルのチェックポイントはファインチューニング前の状態である。ベンチマークSOTAはFine-tunedのヘッドによるものであり、ゼロショット時は与えられた候補セット内での相対スコアリングに限定される。

言語は英語のみ対応で、日本語の構文解析には追加訓練が必要かもしれない。また、埋め込み長は最大2048トークンに制限されている。ヘッドはQwen3-8Bのラストトークンプーリング埋め込みを必須とするため、他の基盤モデルへの置き換えには対応していない。ライセンスはApache 2.0で商用利用も許可されている。

マルチモーダル大規模版の公開予定と未確定点

Contrastive-LMはスケーリングラダーの第一段階として8Bモデルを公開した。より強力な汎化能力を持たせるため、データ量とパラメータ数を増やしたマルチモーダル版CLM-35Bが10月初旬に公開予定である。

35Bモデルはより多くの計算資源と学習データで訓練され、テキストだけでなく画像や動画の候補ランク付けにも対応すると見られる。Notion Blogに掲載された論文では、Jacky Kwokらを著者としてSystem Oneモデルの高速な意思決定能力が解説されている。詳細なアーキテクチャ変更や学習費用はまだ明かされていない。

ベースエンコーダーのQwen3-8Bと重みはApache 2.0ライセンスで公開されている。Discordコミュニティでは推論設定やファインチューニングのノウハウが共有されている。ローカルPCでエージェントの候補検証やツール呼び出しの高速化を図る技術者にとって、10月の35Bモデル公開が次の焦点となる。

用語の注釈

InfoNCE loss
対照学習で用いられる損失関数であり、ミニバッチ内の正例と負例の類似度を比較してモデルを学習させる。(参考:温度パラメータを不要にしたInfoNCE損失(Temperature-Free ...)

出典