Microsoft⁠⁠、選択肢ごとに確率を返すAIモデルMicrosoft-Decision-1を発表 —⁠—分類やAIエージェントの行動評価に対応

Microsoftは2026年10月9日、分類や処理の振り分けなどの判断に特化したAIモデルMicrosoft-Decision-1を発表した。あらかじめ指定した選択肢ごとに確率スコアを返し、アプリケーションやAIエージェントの動作を制御する用途に使える。Microsoft FoundryとOpenRouterで提供している。

選択肢ごとの確率を返し⁠、次の処理につなげる

Microsoft-Decision-1には、判断材料となるテキスト、質問、回答の選択肢を入力する。Yes/No形式や多肢選択式の質問に対応し、各選択肢の確率をJSON形式で返す。採点基準に沿って、AIの回答やエージェントが提案する行動を評価することもできる。

同社は、出力する確率が実際の正答率に対応するよう調整したとしている。アプリケーションはこの値を使い、エージェントが提案する行動を実行するか、人による確認に回すかなどを判断できる。選択肢や確率のしきい値、人へ確認を求める条件は、モデルを組み込む側で設定する。

ベースにはAlibabaのQwen3.5-9Bを採用し、Microsoftが追加学習を施した。1回のモデル呼び出しでスコアを返し、コンテキストウィンドウは32,768トークン。Microsoftは今後、Microsoft AI(MAI)やOpenAIのモデルをベースにする計画も示している。

モデルカタログによると、Microsoft-Decision-1は判断理由の文章を生成しない。入力に含まれない知識を必要とする課題も対象外となる。また、融資や雇用、医療など、人に重大な影響を及ぼす判断の唯一の根拠として使うべきではないとしている。

Microsoftの評価ではGPT-6 Solより約35倍高速

複数の判断を順に行うワークフローでは、判断ごとの待ち時間が積み重なる。Microsoftは、Quyet-1.0-LargeやGPT-6 Luna DecisionsなどのモデルとMicrosoft-Decision-1の性能を比較した。

評価には、学習に用いなかった36種類のベンチマークの約15万問を使用し、多言語や長い文脈を扱う課題などを含めた。Microsoft-Decision-1は比較したモデルの中で正解率が最も高く、処理速度も最も速かったという。応答時間の中央値(P50)では、GPT-6 Solより約35倍高速だったとしている。

各モデルの正解率と応答時間などを比較したMicrosoftの評価結果(Microsoftの発表ブログより)
各モデルの平均正解率、応答時間の中央値、確率スコアのキャリブレーションを並べた比較図。Microsoft-Decision-1の行が黄緑色で強調されている。

判断の安定性については、入力の意味が同じなら判断も変わらないかを調べた。指示の言い換えや選択肢の並べ替えなど、8通りの変更を加えたところ、変更前と異なる判断を返した割合は平均1.3%だったという。

安全性についても、有害な内容やプロンプトインジェクションなどを扱う11種類のベンチマークで、5,250件のリクエストを評価した。同社は、有害でないリクエストに対応する能力を保ちながら、有害な行動を拒否できたと報告している。

Microsoftが紹介した社内試験では、Xbox ResearchがMicrosoft-Decision-1を使い、1万件超のフィードバックやレビューを研究者が決めたテーマに分類した。品質はGPT-6 Solに匹敵し、処理速度は14倍超、費用は200分の1になったとしている。

CEOのSatya Nadella氏もXへの投稿で、インシデント対応、品質管理、科学的発見など、Microsoft社内の幅広い用途で試験を進めていると紹介した。

入力100万トークン当たり0.042ドル⁠、出力トークンは無料

Microsoft-Decision-1は、Microsoft Foundryで一般提供されている。Microsoftが発表した料金は入力100万トークン当たり0.042米ドルで、出力トークンには課金されない。OpenRouterでの料金も同額となっている。

おすすめ記事

記事・ニュース一覧