Anthropic⁠⁠、「Claude Opus 5.5」を発表 —⁠—性能と出力速度を向上⁠⁠、APIの入出力単価をOpus 5比で20%引き下げ

Anthropicは9月22日、AIモデル「Claude Opus 5.5」を発表した。Claude 5.5ファミリーの第1弾で、多くの作業でClaude Fable 5.1に匹敵する性能を持つと説明している。同社のテストでは、デフォルト設定で典型的な作業を行う場合の費用はOpus 5より40%低く、出力速度もOpus 5比で30%超向上したという。Claude Sonnet 5.5とClaude Haiku 5.5も今後数週間で投入を予定している。

コーディングやPC操作を改善⁠、文章も読みやすく

Anthropicは、エージェントによるコーディング、PC操作、知識労働でOpus 5を上回ると説明する。AIエージェントがコマンドライン上で実務的な課題を解けるかを測る「Terminal-Bench 4.0」の課題解決率は、Opus 5.5が66.4%、Opus 5が52.3%だった。ただし、この比較ではOpus 5.5が「xhigh⁠」⁠、Opus 5が「max」と、推論にかける計算量の設定が異なる。Opus 5.5のスコアには、安全策が働いて別モデルに切り替わった試行も含まれる。

複数のアプリを使う長時間のPC操作を評価する「OSWorld 2.0」では、部分点を含むスコアが81.8%で、Opus 5の74.0%を上回った。44職種の実務に近い課題を評価する「GDPval-AA v2.1」では、Eloスコアが1846で、Opus 5の1708を超えた。

文章の生成や作業中の説明も改善したという。Opus 5.5は、要点を先に示し、指定された書き方にも従いやすくなった。モデルの調整に携わったAnthropicのJackson Kernion氏は、文章を明瞭にし、情報を詰め込みすぎないようにする調整に初めて重点を置いたと投稿した。返信では、平易な表現を使い、英文でのセミコロンやダッシュの多用を抑え、専門用語や造語を減らす方向を示した。こうした改善は今後も続けるとしている。

AnthropicはXのスレッドで、Opus 5.5を使った初期の試作例も紹介した。スイカと蟻を題材にした短編アニメーション、写真と公開データを手掛かりに再現したApollo 8の「地球の出」撮影場面、手書き風のUIを持つClaude Codeの画面、スケッチの投石機を3Dにしてシミュレーションするアプリを挙げている。

新モデルの使い方については、Anthropicが開発者向けのOpus 5.5プロンプトガイドと、Claudeアプリ・Claude Code向けの活用ガイドを公開した。プロンプトガイドは、Opus 5向けの既存プロンプトを基本的に使えると説明している。

APIの入出力単価を20%引き下げ

Claude Platformでの通常料金は、入力が100万トークン当たり4ドル、出力が20ドル。Opus 5の5ドル、25ドルからそれぞれ20%下がった。キャッシュからの読み出しは100万トークン当たり0.50ドルから0.20ドルへ60%引き下げた。

単価の引き下げに加え、Anthropicのテストでは作業当たりの使用トークン数も減った。結果として、デフォルト設定で典型的な作業を行う費用はOpus 5より40%低かったという。ただし、Anthropicの料金解説「What a task costs on Opus 5.5」によると、削減幅は作業ごとに異なる。Opus 5.5では回答前の思考をオフにできず、思考に使うトークンも出力として課金されるため、出力トークンが増える場合もある。

情報: 作業費用の考え方や、Claude Codeの/usageで推定費用を確認する方法、エフォートの使い分けについては、別記事「Claude Code⁠⁠、/usageで推定費用を確認する方法を解説」で詳しく紹介している。

推論にかける計算量はデフォルトの「medium」から調整できる。Opus 5.5は、Claude CodeとClaude Platformで提供されている「fast mode」(リサーチプレビュー)にも対応し、通常より最大2.5倍速く出力できる。料金は入力が100万トークン当たり8ドル、出力が40ドルとなる。APIでの利用には申請が必要で、Claude Codeの定額プランでは、プラン内の利用枠とは別に使用量に応じて課金される。

提供先と有料プランの利用枠

Opus 5.5はClaudeアプリ、Claude Code、Claude Platformに加え、Amazon Web Services、Google Cloud、Microsoft Azureなどで利用できる。APIのモデルIDはclaude-opus-5-5。モデルカタログによると、コンテキストウィンドウは100万トークン。信頼できる知識のカットオフと学習データのカットオフは、いずれも2026年6月となっている。

AnthropicのCatherine Wu氏はXへの投稿で、個人向けのPro、MaxプランではOpus 5.5がClaudeアプリ(Coworkを含む)とClaude Codeのデフォルトモデルになったと説明した。ClaudeDevsの公式投稿によると、Claude Codeでは両プランの5時間当たりの使用量上限も20%引き上げられた。

組織向けのTeamプランでもOpus 5.5がデフォルトモデルとなり、Claude Codeの5時間当たりの使用量上限が20%引き上げられた。シート契約のEnterpriseプランでも、5時間当たりの使用量上限を引き上げた。

Anthropicの料金解説「What a task costs on Opus 5.5」によると、Pro、Max、Teamの3プランでは、使用量上限の引き上げとは別に、モデルの値下げによって5時間単位と週単位の枠で使える量がOpus 5比で約25%増えるという。3プランの利用者は、10月22日までの任意の時点で使用量を1回リセットできる。

安全策と安全性評価

Anthropicはコーディング用途の安全策として、各操作の内容を実行前に検査する分類器、監査できるオープンソースのサンドボックス、脆弱性を検出するコードレビューを挙げる。生物学やサイバーセキュリティなどの分野には、Fable 5.1と同種の安全策を適用する。

ClaudeアプリとClaude Codeでは、生物学やサイバーセキュリティに関する要求が安全策によって制限された場合、デフォルトで利用者に知らせた上で別モデルに切り替えて対応する。設定を変更すれば、自動では切り替えず、利用者に確認するようにもできる。APIでの切り替えは、開発者が有効にした場合だけ行われる。切り替え先は、生物学分野ではOpus 5、サイバーセキュリティ分野ではOpus 4.8となる。通常のソフトウェア開発に伴う不具合の発見や修正には、Opus 5.5を引き続き使える。

生物学分野の研究開発で通常の安全策が支障になる組織は、審査制の「Life Sciences Verification Program」への参加を申請できる。参加が認められれば、研究開発向けに調整した安全策のもとでOpus 5.5を利用できる。防御目的のサイバーセキュリティ業務で制限を緩める既存の「Cyber Verification Program」にも、今後数週間でOpus 5.5の追加を予定している。

AnthropicはAPIで、過去の応答に含まれる推論の記録を会話の続きで再利用する際の安全策「preserved thinking」をOpus 5.5に導入した。APIはアカウントの作成時期にかかわらず、現在使うモデルがその記録に対応しているかを確認する。対応していない記録は、モデルに渡す前に取り除かれる。また、推論の記録を再利用する際には、記録を作るまでの会話履歴やシステム指示、ツール設定が元のままかも調べる。8月31日以降に作成したアカウントでは、会話履歴などの変更が見つかると、デフォルトでその記録の再利用を止める。それより前のアカウントでも、開発者がリクエストで指定すれば、この制限を適用できる。

公開前にはMETRやFrontier Designなどの外部組織もモデルを評価した。Anthropicは自社の行動監査で約1900種類の利用場面を想定し、有害な要求への対応などを調べた。同社によると、Opus 5.5は比較対象とした最近のClaudeモデルをほぼすべての指標で上回った。ただし、モデルがテスト中であることを察している兆候があり、この結果だけで実際の利用時の振る舞いを予測するのは難しいという。システムカードには、この監査では複数のエージェントが相互に影響し合う状況や、長期にわたる作業の検証が手薄だと記されている。

システムカードはまた、第三者が悪意ある指示を仕込んだREADMEやメールなどのテキストを、利用者がプロンプトに貼り付ける場面を取り上げた。コーディング作業を想定した評価では、公開前のOpus 5.5の初期版はOpus 5やSonnet 5より、その指示に従いやすかった。その後、学習を調整した公開版モデルを追加の入力対策なしで評価したところ、悪意ある指示に従った割合はデフォルトの「medium」で約2%、最高の「max」で約7.4%だった。同社はさらに、貼り付けたテキストから、画面には表示されないがモデルには読める文字を取り除き、そのテキストが貼り付けられたものだとモデルに示す仕組みも加えた。この仕組みを公開版モデルと組み合わせたテストでは、悪意ある指示に従った例はなかったという。

おすすめ記事

記事・ニュース一覧