格下のはずが本家超え——Claude Sonnet 5.5、コーディングでOpus 5.5を上回った中身
Terminal-Bench 4.0という、AIエージェントが実際の端末を操作してタスクをこなす力を測るベンチマークがあります。
ここでClaude Sonnet 5.5が記録したスコアは70.6%。
上位モデルのはずのOpus 5.5は66.4%でした。
価格はOpus 5.5のちょうど半分です。
AIにコードを書かせたり、エージェント経由で作業を自動化したりしている人にとって、「下位モデルが上位モデルを上回る」というこの逆転は見過ごせない話のはずです。
今どちらのモデルを選ぶべきかが、この発表で変わったかもしれません。
先に結論をまとめると:
– Anthropicは2026年9月28日、Claude Sonnet 5.5を発表しました。
Sonnet 5比で処理速度が30%以上速くなり、作業によっては最大30%のコスト削減になります
– コーディング系ベンチマーク「Terminal-Bench 4.0」でSonnet 5.5が70.6%を記録し、上位モデルOpus 5.5の66.4%を上回りました
– 料金はSonnet 5と同じ据え置き(入力$2・出力$10/百万トークン、Opus 5.5の半額)で、claude.aiとAPIで即日利用できます
Anthropic公式が発表直後に伝えた性能と価格
Anthropicの公式Claudeアカウントは発表と同時に、次のように投稿しています。
Claude Sonnet 5.5を発表します。
Claude 5.5ファミリーの2番目のモデルで、Sonnet 5からの明確なアップグレード。
動作速度は30%以上速く、ほとんどの作業でコストは最大30%抑えられる——投稿はそう伝えています。
Introducing Claude Sonnet 5.5, the second model in the Claude 5.5 family.
— Claude (@claudeai) 2026年9月28日
It’s a clear upgrade over Sonnet 5, runs more than 30% faster, and costs up to 30% less for most work. pic.twitter.com/UvXD8mDTF1
投稿の文面だけでは「本当にOpus 5.5を上回ったのか」までは分かりません。
ベンチマークの中身と、Anthropicが公開している価格表を確かめました。
調べて分かったこと
なぜ下位モデルが上位モデルを超えられたのか?
Terminal-Bench 4.0は、AIエージェントに実際のターミナル操作を任せて完遂できるかを測るベンチマークです。
旧モデルのSonnet 5はここで10.3%というスコアでした。
Sonnet 5.5はそこから70.6%まで伸び、Opus 5.5の66.4%を追い抜いています。
この差について、Claudeの公式アカウントはXで次のように補足しています。
複数のベンチマークで、Sonnet 5.5は「Low」または「Medium」の処理負荷でも、Sonnet 5の最高スコアをおよそ10分の1のコストで上回った——投稿はそう報告しています。
On several benchmarks, Sonnet 5.5 at Low or Medium effort beats Sonnet 5’s best score for about a tenth of the cost. pic.twitter.com/d7uuPEe9TA
— Claude (@claudeai) 2026年9月28日
一方でAnthropicは、Opus 5.5について「680,000行規模のコード移行を1日足らずで終えた」という早期テスターの評価や、財務分析・定量リサーチを最低負荷設定でも「ほぼ解けた」という評価を挙げています。
つまりOpus 5.5は、Sonnet 5.5が苦手とする規模の大きい・判断の難しい作業で強みを発揮するよう作られています。
今回Sonnet 5.5が上回ったのは、端末操作という限られた領域のベンチマークだった、という見方ができます。
実際、業務全般の遂行力を測るGDPval-AA v2.1では、Sonnet 5.5が1844点、Opus 5.5が1846点とほぼ横並びでした。
Sonnet 5.5は特定の領域で急激に強くなった一方、総合力でもOpus 5.5にかなり近づいている、というのがベンチマークから読み取れる実態です。
Sonnet 5.5とOpus 5.5、結局どちらを使えばいいのか?
料金表を見ると、Sonnet 5.5は入力$2・出力$10(百万トークンあたり)、Opus 5.5は入力$4・出力$20と、ちょうど2倍の差がついています。
Anthropicはこの使い分けについて、Opus 5.5を「慎重な判断が必要な複雑な作業」向け、Sonnet 5.5を「範囲が明確な日常的な作業(バグ修正、ドキュメントやスプレッドシート作成など)」向けと説明しています。
バグ修正や定型のコーディング作業が中心なら、Sonnet 5.5に切り替えるだけで体感速度とコストの両方が改善する可能性があります。
逆に、大規模な移行作業やリサーチのように判断の質が問われる場面では、価格差はあってもOpus 5.5を選ぶ理由が残っています。
Shiritomo編集部の考察:明日からやることは使い分けの見直し
これまで「Opus 5.5=高性能・高価格、Sonnet 5.5=それ以外」という単純な序列で捉えていた開発チームは、少なくともコーディング用途については前提を見直す価値があります。
特にAPI経由でエージェントを常時稼働させている運用では、タスクの規模に応じてモデルを切り替えるだけで、月間のAPI費用が実質的に下がるケースが出てくるはずです。
過去にもAnthropicは、上位モデルの機能を下位モデルへ段階的に降ろす設計を繰り返してきました。
今回のSonnet 5.5は、その中でも「特定領域で上位モデルを追い抜く」という珍しい例です。
同種のアップデートが今後も続くなら、モデル選定は一度決めて終わりではなく、ベンチマーク更新のたびに見直す運用が必要になってきそうです。
まとめ
Claude Sonnet 5.5は、価格を据え置きながら速度とコーディング系ベンチマークのスコアを大きく伸ばし、端末操作を伴う作業では上位モデルのOpus 5.5を上回りました。
ただし判断の難しい大規模作業ではOpus 5.5の優位が残っており、「安い方が常に有利」ではなく、作業の性質に応じた使い分けが引き続き必要です。
さらに深掘りしたい方へ
Claude Sonnet 5.5の詳しい仕様やベンチマーク結果は、Anthropicの公式ページにまとまっています。