次の操作や使うツールを高速に選ぶAIモデル「CLM-8B」公開 —⁠—Jevと比べて最大9倍の推論速度と報告

スタンフォード大学のJacky Kwok氏らは9月23日、AIモデルの新たな方式「Contrastive Language Model(CLM⁠)⁠」と、この方式で開発した「CLM-8B」を公式サイトで発表した。AIエージェントが次に行う操作や使うツールを、与えられた選択肢から高速に選ぶ。CLM-8Bは、コンピューター操作、ゲーム、ツール呼び出しの評価で、TypeSafe AIの判断モデルJevと同程度の性能を保ちながら、最大9倍の推論速度を達成したという。

コードはGitHub、モデルはHugging Faceで公開している。

判断に使う情報と選択肢を別々に処理

Kwok氏らはCLMを、高速な判断を行う「System One Model」と呼んでいる。操作やツールの選択に加え、質問に対して複数の回答から適切なものを選ぶ用途にも使える。

公開コードには、CLM-8BをAPI経由で利用するためのサーバー実装も含まれる。このAPIは、選択結果や各候補の確率、スコアなどを、ソフトウェアで扱いやすい構造化データとして返す。

CLMの内部では、作業の状況や質問など、判断の前提となる情報を「状況(state⁠)⁠」⁠、選択対象となる操作や回答などを「行動(action⁠)⁠」として扱う。それぞれを別のエンコーダーに入力し、内容の特徴を数値の列で表した埋め込みベクトルに変換する。

学習には、状況の埋め込みベクトルを正解の行動のベクトルに近づけ、他の候補のベクトルから遠ざける対照学習(contrastive learning)を使う。利用時は状況と各候補のベクトルを比較し、最も高いスコアの行動を選ぶ。

この構成により、状況と行動の埋め込みベクトルを別々に保存し、再利用できる。例えばゲームの状況が変わっても、選べる操作が同じなら、操作のベクトルを毎回計算し直す必要がない。

比較対象のJevは、ソフトウェアが利用する判断結果を、確率や確信度とともに返すモデル[1]。Kwok氏によると、Jevが計算結果を保存して再利用できるのは状況側に限られ、行動側も再利用できるCLMとの速度差につながるという。

なお、モデルカードによると、CLMは文章の生成には対応しない。候補ごとに返す確率は、与えられた選択肢の中での相対的な値で、選択肢の組み合わせによって変わる。

CLM-8BはQwen3-8Bを基盤に⁠、3段階で学習

公開モデルの名称は「CLM-v0.1-8B⁠」⁠。言語モデルQwen3-8Bを基盤に、その出力ベクトルを変換する小さな層を状況側と行動側にそれぞれ加えた構成を採る。学習では、Qwen3-8Bのパラメーターを固定し、追加した層のパラメーターだけを更新する。

事前学習には、Nemotron DQAの約6000万組の質問・回答ペアを使い、質問を状況、回答を行動として扱った。次に、正解と見分けにくい誤答を含む約3000万件の合成データで学習した。最後に、約100万件のエージェントの行動履歴を使い、実際の作業での行動選択に適応させた。

Qwen3-8Bのパラメーターを固定しているため、同じ入力から得られるベクトルは事前に計算して再利用できる。公式ブログによると、この前処理を済ませれば、追加した層をNemotron DQAで事前学習するのにかかる時間は、RTX 4090 GPU 1基で約1時間という。

Kwok氏らは、学習に使う計算量やデータ量、モデルの規模を増やしたとき、性能がどう変わるかを示す「スケーリング則」も報告した。評価には、状況と正解の行動を結び付けられるほど小さくなる対照学習の指標「損失」を用いた。学習に使っていないデータで測った損失が、計算量などの拡大に伴ってべき乗則に従い低下したという。

性能を引き出すには、計算量やデータ量とともに、エンコーダーと追加した層の規模も拡大する必要があるとしている。改善効果は、エンコーダーを大規模化した場合が最も大きかったという。

行動選択の速度と⁠、コーディング解答の選別を評価

最大9倍の高速化は、用途ごとの追加学習を行わないゼロショット評価で報告された。

選択肢が多いWikiRacingや、選べる操作が変わらないT-Rexゲームで、特に速度差が大きかったという。Kwok氏は、WikiRacingの動作例も動画で公開している。

コーディング課題では、追加学習したCLMで複数の解答候補を採点し、課題を解決できる候補を選べるかを評価した。CLMが選んだ解答による課題の解決率は、DeepSWEで81.6%、Terminal-Bench 2.1で87.6%。Kwok氏らは、両方で最高水準の成績を達成したとしている。

GitHubの評価説明によると、DeepSWEではOpus 5、Terminal-Bench 2.1ではFable 5が解答候補を生成し、CLMが選別した。評価対象は、学習に使っていないDeepSWEの38課題とTerminal-Bench 2.1の30課題。このうちDeepSWEでは、4候補から選ぶ条件で31課題を解決した。

同じ評価でJevに解答を選ばせた場合の解決率は、候補を無作為に1つ選んだ場合を下回ったという。この評価でのCLMの推論速度はJevの4~6倍と報告されており、推論時間の測定にはH100 GPUを使用した。

公開しているCLM-v0.1-8Bは、こうした用途別の追加学習の出発点に当たる。コードとCLM-8Bの学習済みパラメーターはApache 2.0ライセンスで提供している。

今後は画像や動画なども扱えるようにし、ロボットやコンピューター操作への応用を進める方針。Kwok氏は、マルチモーダル版の「CLM-35B」を学習中で、10月上旬の公開を予定している。

おすすめ記事

記事・ニュース一覧