スタンフォード大学のJacky Kwok氏らは9月23日、AIモデルの新たな方式
コードはGitHub、モデルはHugging Faceで公開している。
判断に使う情報と選択肢を別々に処理
Kwok氏らはCLMを、高速な判断を行う
公開コードには、CLM-8BをAPI経由で利用するためのサーバー実装も含まれる。このAPIは、選択結果や各候補の確率、スコアなどを、ソフトウェアで扱いやすい構造化データとして返す。
CLMの内部では、作業の状況や質問など、判断の前提となる情報を
学習には、状況の埋め込みベクトルを正解の行動のベクトルに近づけ、他の候補のベクトルから遠ざける対照学習
🧵(1) Model Architecture
— Jacky Kwok (@jackyk02) September 23, 2026
CLM first trains a state encoder and an action encoder on a large-scale dataset with a contrastive objective, so that each state is pulled toward the ground-truth action and pushed away from all others. The two encoders then serve directly as a zero-shot… pic.twitter. com/ BbyLKoJGOJ
この構成により、状況と行動の埋め込みベクトルを別々に保存し、再利用できる。例えばゲームの状況が変わっても、選べる操作が同じなら、操作のベクトルを毎回計算し直す必要がない。
🧵(7) Dino Run Demo pic.
— Jacky Kwok (@jackyk02) September 23, 2026twitter. com/ qSybmYJ4P0
比較対象のJevは、ソフトウェアが利用する判断結果を、確率や確信度とともに返すモデル[1]。Kwok氏によると、Jevが計算結果を保存して再利用できるのは状況側に限られ、行動側も再利用できるCLMとの速度差につながるという。
なお、モデルカードによると、CLMは文章の生成には対応しない。候補ごとに返す確率は、与えられた選択肢の中での相対的な値で、選択肢の組み合わせによって変わる。
CLM-8BはQwen3-8Bを基盤に、3段階で学習
公開モデルの名称は
事前学習には、Nemotron DQAの約6000万組の質問・
Qwen3-8Bのパラメーターを固定しているため、同じ入力から得られるベクトルは事前に計算して再利用できる。公式ブログによると、この前処理を済ませれば、追加した層をNemotron DQAで事前学習するのにかかる時間は、RTX 4090 GPU 1基で約1時間という。
Kwok氏らは、学習に使う計算量やデータ量、モデルの規模を増やしたとき、性能がどう変わるかを示す
性能を引き出すには、計算量やデータ量とともに、エンコーダーと追加した層の規模も拡大する必要があるとしている。改善効果は、エンコーダーを大規模化した場合が最も大きかったという。
行動選択の速度と、コーディング解答の選別を評価
最大9倍の高速化は、用途ごとの追加学習を行わないゼロショット評価で報告された。
🧵(5) Zero-Shot Evaluation
— Jacky Kwok (@jackyk02) September 23, 2026
Across computer-use, gaming, and tool-calling tasks, CLM-8B performs on par with Jev while running up to 9× faster. The speedups are most pronounced when the number of candidates is large (e.g., WikiRacing) or when actions can be reused frequently… pic. twitter. com/ 7SDvMTZYko
選択肢が多いWikiRacingや、選べる操作が変わらないT-Rexゲームで、特に速度差が大きかったという。Kwok氏は、WikiRacingの動作例も動画で公開している。
🧵(9) WikiRacing Demo pic.
— Jacky Kwok (@jackyk02) September 23, 2026twitter. com/ kokUhH25zZ
コーディング課題では、追加学習したCLMで複数の解答候補を採点し、課題を解決できる候補を選べるかを評価した。CLMが選んだ解答による課題の解決率は、DeepSWEで81.
GitHubの評価説明によると、DeepSWEではOpus 5、Terminal-Bench 2.
同じ評価でJevに解答を選ばせた場合の解決率は、候補を無作為に1つ選んだ場合を下回ったという。この評価でのCLMの推論速度はJevの4~6倍と報告されており、推論時間の測定にはH100 GPUを使用した。
🧵(6) Agentic Benchmarks
— Jacky Kwok (@jackyk02) September 23, 2026
We find that Jev fails to serve as a verifier for long-horizon tasks, performing below the random-selection (Pass@1) baseline.
In contrast, with lightweight fine-tuning, CLM achieves SOTA performance on challenging agentic benchmarks, including DeepSWE… pic.twitter. com/ PElaTjW4vs
公開しているCLM-v0.
今後は画像や動画なども扱えるようにし、ロボットやコンピューター操作への応用を進める方針。Kwok氏は、マルチモーダル版の