OpenAI⁠⁠、「GPT-6 Sol」「GPT-6 Luna」を発表 —⁠—速度と費用効率を重視⁠⁠、API入出力単価はGPT-5.6版比でSolが半額⁠⁠、Lunaが半額以下に

OpenAIは9月22日、GPT-6シリーズの新モデル「GPT-6 Sol」と「GPT-6 Luna」を発表した。GPT-6 Astraの強みを日々の仕事にも活かすため、SolとLunaでは速度と費用効率を重視したという。Solは複雑なコーディングやAIエージェントによる作業を、Lunaは大量の処理を主な用途とする。APIの標準単価は、対応するGPT-5.6版のプロモーション価格と比べ、Solでは入力・出力ともに半額となった。Lunaも入力は半額、出力は約58%の値下げとなる。

ChatGPT Work⁠・Codex⁠・APIで提供

GPT-6 SolとGPT-6 Lunaは、Plus、Pro、Business、Enterprise、Eduのプラン利用者向けにChatGPT WorkとCodexで順次提供される。FreeとGoの利用者はデスクトップアプリでLunaを試せる。両モデルとも、発表時点ではChatGPTの「Chat」で利用できない。

OpenAIは、Astraの明瞭で簡潔な答え方を両モデルにも取り入れたという。専門用語や不自然な言い回し、不要な細部が減り、技術やコーディングの会話では特に変化が目立つと見込んでいる。

OpenAI APIでは、SolとLunaをそれぞれgpt-6-solとgpt-6-lunaとして利用できる。モデル情報によると、両モデルともコンテキスト長は最大105万トークン、最大出力は12万8000トークン。知識のカットオフは、Solが2026年4月20日、Lunaが同年5月18日となっている。

両モデルとも推論レベルは「none」から「max」まで選べる[1]。推論を伴うツール呼び出しにはResponses APIを使う。Chat Completions APIでは、推論レベルを「none」にした場合に限って関数呼び出しに対応する。

GPT-6のモデルガイドでは、Astraの挙動を踏まえたプロンプト例を、Sol・Lunaを含むGPT-6シリーズ共通の参考として紹介している。そのうえで、使用するモデルと実際の用途に応じて、プロンプトの効果を確認するよう勧めている。

API料金を引き下げ⁠、キャッシュも改善

APIの標準料金は、100万トークン当たりGPT-6 Solが入力2ドル・出力10ドル、GPT-6 Lunaが入力0.10ドル・出力0.50ドルとなる。発表ブログでは、比較対象のGPT-5.6版の価格を「プロモーション価格」としており、Solが入力4ドル・出力20ドル、Lunaが入力0.20ドル・出力1.20ドルとなっている。

入力が27万2000トークンを超える場合、リクエスト全体の入力・キャッシュ単価は2倍、出力単価は1.5倍になる。

値下げの背景として、OpenAIは推論処理とプロンプトキャッシュの効率改善を挙げる。キャッシュに関する別の記事「Better Prompt Caching for GPT-6」によると、GPT-6シリーズでは入力の冒頭から一致する部分のキャッシュヒット率が高まったという。キャッシュの有効期間は、最後の保存または再利用から少なくとも30分間。キャッシュから読み取った部分の料金は通常の入力単価の10分の1で、書き込みは1.25倍となる[2]。

開発者はキャッシュするプロンプトの冒頭部分を指定し、ダッシュボードや診断ツールでヒット率やキャッシュミスの原因を調べられる。また、会話の途中で推論レベルを変更する際も、キャッシュを維持できる設定方法が用意されている。ツールも、定義を保ったまま利用可否を切り替えれば、保存済みの入力を再利用できる。

性能と費用効率の評価結果

OpenAIによると、ソフトウェア開発の課題を扱う「DeepSWE v1.1」では、GPT-6 SolとGPT-6 Lunaをともに推論レベル「max」で評価し、スコアはそれぞれ68.8%、66.6%だった。Solの結果はClaude Fable 5が「xhigh」で記録した69.9%に近く、1タスク当たりのコストは約80%低いとしている[3]。

業務アプリを使った作業を測る「AutomationBench」では、GPT-6 Solは推論レベル「xhigh」で33.2%、Claude Opus 5は「max」で26.9%を記録している。GPT-6 Lunaを「high」で評価した結果、GPT-5.6 Lunaより5.4ポイント高いスコアを記録し、1タスク当たりのコストは58%低かったという。

利用者が事実誤認を指摘したChatGPTの会話を匿名化して使った社内評価では、GPT-6 Solの誤りがGPT-5.6 Solの約半分だったという。同じ評価で、GPT-6 Lunaは高い推論レベルでGPT-5.6 Solと同程度の正確さを示し、その際のコストは約100分の1だったとする。この結果は、通常利用での誤答率を示すものではない。

PC操作を測る「OSWorld 2.0」オフライン版では、GPT-6 Solは「xhigh」で60.5%、Claude Opus 5は「medium」で60.3%を記録した。GPT-6 Lunaの「max」はGPT-5.6 Solの「medium」を上回り、1タスク当たりのコストは10分の1だったという。

安全対策と評価結果

OpenAIによると、GPT-6 SolとGPT-6 Lunaはアラインメント評価でそれぞれのGPT-5.6版より良い結果を示し、コーディング作業で何をしたかについて誤解を招く説明も減ったという。

9月22日に追加されたシステムカードのSol・Luna追補では、両モデルのリスクに関わる能力を評価し、GPT-5.6版と同じ安全対策を適用したと説明している。生物・化学の能力は「High⁠」⁠、AI自己改善の能力は「High」未満と判定した。

サイバーセキュリティ分野の能力は「High」で、さらに上の「Critical」には達していない。同分野の安全性評価では、模擬的なエージェント環境での平均スコアはGPT-5.6 Solとおおむね同等だったが、実運用のチャットに基づく評価では小幅に低下した。

安全対策を回避して不適切な回答を引き出す「脱獄」攻撃への耐性を調べた別の評価では、両モデルともGPT-5.6 SolやGPT-5.5 Thinkingより高い防御成功率を示した。ただし、Lunaの高いスコアには、正当な依頼まで拒む傾向が影響した可能性もあるという。

医療関連の評価では、回答の長さを考慮した両モデルのスコアが、それぞれのGPT-5.6版と比べ、「⁠HealthBench Professional」と「HealthBench Consensus」で維持または改善し、「⁠HealthBench」と「HealthBench Hard」で低下した。システムカードは、低下した2項目では回答が短くなり、評価項目が求める詳細の記述も減ったと説明している。

おすすめ記事

記事・ニュース一覧