ChatGPT 読了 6 分

「縦軸見て横転」――GPT-6.1 SolがOpus 5.5を上回ったベンチマーク、笑いどころは比較の仕方だった

Shiritomo編集部 @shiritomoAI_jp 2026年10月2日 更新
「縦軸見て横転」――GPT-6.1 SolがOpus 5.5を上回ったベンチマーク、笑いどころは比較の仕方だった

「縦軸見て横転」。

そう一言だけ添えられたグラフのスクリーンショットに、1万4000件を超えるいいねが集まりました。
グラフでは、GPT-6.1 Solに有利な条件とOpus 5.5の数値が同じ条件でそろえられておらず、条件をそろえ直すと差が縮む、あるいは逆転するとみられたからです。

描かれていたのは、OpenAIが9月29日のDevDay 2026で発表した新モデル「GPT-6.1 Sol」が、Anthropicの「Claude Opus 5.5」を上回ったとする内部ベンチマークの比較グラフでした。
ChatGPTやClaude、Geminiを日常的に使い分けている人なら、「結局どのAIが一番賢いのか」は何度も気になったことがあるはずです。
グラフ1枚の裏で何が起きていたのか、調べてみました。

先に結論をまとめると:
– OpenAIの新モデル「GPT-6.1 Sol」は、Claude Opus 5.5よりかなり安いコストで、一部のベンチマークを上回りました
– ただし「上回った」のは特定の条件下だけで、AIに処理の手間を多くかける設定にするとOpus 5.5が逆転します
– GPT-6.1 Solに有利な条件とOpus 5.5の数値が同じ条件でないことに気づいた人たちが、ネタとして拡散させました

XでOpenAIの内部グラフが笑いのネタに

GPT-6.1 Solは、1週間前に出たばかりの「GPT-6 Sol」、そして26日前に発表された最上位モデル「GPT-6 Astra」に続く、OpenAIの中位モデルという位置づけです。
発表直後、OpenAI自身が公開した性能比較のグラフがXで急速に広まりました。

このグラフを巡っては、縦軸のラベルのつけ方がネタにされただけでなく、AIの進化のスピードをWindowsのバージョンアップに例えるミームも一緒に広まりました。
「また新しいのが出たのか」という、半ば呆れたような空気が漂っていたのが印象的です。
ただ、笑ってばかりもいられません。
このグラフが本当に誇張だったのか、実際の性能差はどうだったのか、一次情報に近いベンチマークサイトの分析を確認してみました。

調べて分かったこと

本当にOpus 5.5を上回っているのか?

複数のベンチマーク分析サイトの計測によれば、AIエージェントが実際の作業をどれだけこなせるかを測る「AutomationBench」というテストで、GPT-6.1 SolはOpus 5.5より2.2ポイント高いスコアを記録したとされています。
しかもこれは、AIに考える手間(計算量)を中程度に設定した条件での結果で、コストはOpus 5.5のおよそ3分の1だったとのことです。

ここだけ見ると、確かにGPT-6.1 Solの圧勝に見えます。
実際、このコスト効率の良さを喜ぶ声も目立ちました。

設定を変えるとどうなるのか?

ところが、AIにかける計算量を最大まで引き上げた条件では、結果が入れ替わります。
同じ分析によると、Opus 5.5が42.5%というトップスコアを記録し、GPT-6.1 Solの36.1%を6.4ポイント上回ったと報告されています。
つまり「どちらが優秀か」は、どれだけコストと時間をかけるかという条件次第で変わるのです。
OpenAIが公開したグラフは、GPT-6.1 Solが有利になる条件を切り取って見せていた可能性が高く、これが「縦軸見て横転」という反応につながったとみられます。

価格面では、GPT-6.1 Solは入力100万トークンあたり2ドル、出力10ドルという設定で、最上位モデルAstraの5分の1の価格です。
プログラミング用のベンチマーク「Terminal-Bench Science 0.1」でも、GPT-6.1 Solは1タスクあたり5.47ドルで完了させたのに対し、Opus 5.5は23.21ドルかかったとされ、コスト面での強みは際立っています。

結局、どちらを選べばいいのか?

日常的にAIツールを使い分けている人の間では、すでに答えが出始めているようです。

この投稿のように、複数のAIモデルを用途別に格付けし、Opus 5.5を依然として最上位に置くユーザーの声も見られました。
1つのAIに決め打ちするのではなく、作業の重さに応じてモデルを選ぶという発想は、料金プランが複雑化する中でますます現実的な選択肢になりつつあります。

Shiritomo編集部の考察:企業公式グラフほど疑ってかかる

SNS上でのバズり方を見ていると、今回の件はベンチマーク性能そのものよりも「企業が自社に都合の良いグラフを出した」という構図そのものが笑いのネタにされた側面が強いように見えます。
AI各社はここ数ヶ月、新モデルを出すたびに自社比較グラフを公開していますが、見る側にも「縦軸や条件を確認する」リテラシーが育ってきている印象です。
企業公式発表のグラフほど、どの条件を切り取っているかを疑ってかかる姿勢が、今後はますます求められそうです。

まとめ

GPT-6.1 SolはOpus 5.5よりコスト効率で優位に立ちましたが、処理に手間をかける条件ではOpus 5.5が依然としてトップでした。
1枚のグラフを鵜呑みにせず、条件ごとの強みを見極める目が、ユーザー側にも試されています。

さらに深掘りしたい方へ

OpenAI、「OpenAI版のGrokBot」と称された自律型エージェント「dots」を投入 新モデルはAstra同等の性能で価格1/5にOpenAI、「OpenAI版のGrokBot」と称された自律型エージェント「dots」を投入 新モデルはAstra同等の性能で価格1/5にDevDay 2026で発表された新機能「dots」と、同時発表のGPT-6.1 Solの価格・性能について
格下のはずが本家超え——Claude Sonnet 5.5、コーディングでOpus 5.5を上回った中身格下のはずが本家超え——Claude Sonnet 5.5、コーディングでOpus 5.5を上回った中身Terminal-Bench 4.0でSonnet 5.5が70.6%を記録、上位モデルOpus 5.5を上回った理由
「もうだいぶ飽きた」の裏で――Claude Opus 5.5とOpus 5、同じプロンプトで生成したゲームの違い「もうだいぶ飽きた」の裏で――Claude Opus 5.5とOpus 5、同じプロンプトで生成したゲームの違い同じ指示文でOpus 5.5と旧モデルOpus 5が生成したゲームを比較した結果

ベンチマークの詳しい数値は、DataCampのGPT-6.1 Sol解説記事でも確認できます。