Claude 読了 9 分

Claude Opus 5.5「ナーフ」疑惑、独自追跡ベンチマークの判定は「正常範囲内」

Shiritomo編集部 @shiritomoAI_jp 2026年10月8日 更新
Claude Opus 5.5「ナーフ」疑惑、独自追跡ベンチマークの判定は「正常範囲内」

103.8%から94.2%へ。
たった1日でこれだけスコアが落ちれば、「やっぱり弱くされたのでは」と思うのも無理はありません。
9月22日にリリースされたAnthropicの最新モデル「Claude Opus 5.5」をめぐり、10月に入ってから変化を指摘する声が出てきました。
「急に賢さが落ちた」と感じるユーザーの投稿が、Xで見られるようになったのです。
AIを日常的に使っている方、API料金を払って開発に使っている方にとって、体感の変化はモデル側の問題なのか気になるところでしょう。

先に結論をまとめると:
– Opus 5.5を独自に追跡するベンチマーク「NerfBench」のスコアは10月1日の103.8%から10月2日に94.2%へ急落したが、これは定義上「通常の変動範囲内(90〜110%)」
– NerfBenchは9月28日未明の初回測定時点でも「ナーフは検出されず」と判定しており、Anthropicがモデルの中身を弱めたという確証はまだ出ていない
– 一部では「effort(思考の深さ)」設定の違いが体感の変化につながっている可能性も指摘されている

Xで見られた「急に賢さが落ちた」という声

Claude Opus 5.5は、Anthropicの歴代モデルと比べて低コストでありながら高い性能を実現したとして、リリース直後は高く評価されていました。
ところが10月に入ってから、同じ使い方をしているのに出力の質が落ちたと感じるという投稿が出てくるようになります。

この手の「ナーフ疑惑」は今回が初めてではなく、AIモデルの世界でたびたび起きてきました。
発売直後は高評価だったモデルが数週間後には「鈍くなった」と言われ、しかしラボ側は変更を認めず証拠も示されない——そうしたやり取りが繰り返されてきた背景があります。
この状況を検証するために作られたのが、モデルの性能をローンチ日の数値と毎日比較し続ける追跡ツール「NerfBench」です。
運営元のBridgeMindは、Opus 5.5のスコアが大きく動いた際にこう投稿しています。

Claude Opus 5.5のNerfBenchスコアが大きく下落しました。
前日はローンチ時を上回るスコアだったのに、今日は94.2%。
GPT 6 Astraは98.0%、Sonnet 5.5は100.9%、GPT 6.1 Solは106.7%です。
94.2%はまだ通常の変動範囲内なので、ナーフとは言い切れません。
ただ、Opus 5.5は引き続き注視しています。

ただ、この数字だけでは「ナーフされた」と結論づけるには早計です。
そこでNerfBenchがどういう基準で判定しているのか、もう少し調べてみました。

調べて分かったこと

NerfBenchの「正常範囲」とはどういう基準か?

NerfBenchは、モデルをローンチ当日と同じ課題・同じプロンプトで週3回以上再テストし、ローンチ時のスコアを100%としたときの相対値を出す仕組みです。
BridgeMind自身が、90%から110%までの変動は「正常な範囲」と定義しています。
実際の推移を見ると、初回測定(日本時間9月28日未明)の時点でOpus 5.5は99.2%(ローンチ比-0.8%)で、BridgeMindは次のように投稿していました。

Claude Opus 5.5はナーフされたのか。
NerfBenchの最初の結果が公開されました。
Opus 5.5とGPT 6 Astraを、ローンチ時のスコアと比較して再テストしました。
結果はOpus 5.5が99.2%(ローンチ比-0.8%)、GPT 6 Astraが102.8%(同+2.8%)。
判定:ナーフは検出されず。
Opus 5.5のわずかな低下と……

その後10月1日に103.8%まで上がったあと、翌10月2日に94.2%まで落ちたのが、冒頭の投稿です。
海外メディアの分析でも「重みレベルのナーフを示す説得力のある証拠はまだない」とされています。
ユーザーが感じている変化は、モデル本体の重みが変わったというより、サーバー側の処理など別の要因による可能性も指摘されています。

なぜ「賢さが落ちた」と感じる人がいるのか?

NerfBenchの数値上は大きな弱体化が確認されていない一方で、体感の変化そのものは説明がつきそうな理由があります。
海外の検証記事によると、AIモデルの「effort」(思考にどれだけ時間・トークンを使うかの設定)を意図的に下げたテストが行われました。
出力トークン数は最大62%減ったのに対し、正答率の低下は8.3ポイントにとどまったと報告されています。
つまり「考える量」を減らすと、答えの正しさより先に、出力の丁寧さや説明の厚みが目に見えて減るということです。
Xの投稿の中にも、Opus 5.5は蒸留(大きなモデルの能力を小さなモデルに移す技術)で作られた小型モデルではないかという見方を示すものがありました。

Anthropic製品の歴代比較の話として、Opus 5.5は蒸留で作られた小さいサイズのモデルだという見方。
表現の幅が減る分、詩が下手になるのは必然だとしています。
逆にOpus 4.5はAnthropic歴代でもっとも高価、つまりサイズが大きいため、創作であればOpus 4.5のほうが良いかもしれないという意見です。

出力が簡潔になったこと自体は、モデルの中身が弱くなったことの証明にはなりません。
ただ、こうした仕組みを知っておくと、「なぜか雑に感じる」ときに真っ先に疑うべき設定が分かります。

Shiritomo編集部の考察:「ナーフされた」より先に効果を測る視点を

今回の件で興味深いのは、「弱くされた」という印象を感覚ではなく数値で検証しようとするツールが、ユーザーコミュニティの側から生まれたことです。
ラボが沈黙を守る以上、外部から継続的に計測し続ける仕組みがなければ、噂は噂のまま固定化してしまいます。
SNS運用やプロダクト開発でAIを使っている立場からすると、「調子が悪い」と感じたときにまず疑うべきはモデルそのものではないかもしれません。
自分側の設定(effortやプロンプトの長さ)を先に見直す価値がありそうです。
NerfBenchのような第三者計測は、今後も主要モデルのたびに同じ議論が起きることを考えると意味のある動きです。
感覚ではなく数字で判断材料を持てる点が大きいでしょう。

まとめ

Claude Opus 5.5をめぐる「ナーフされた」という声に対し、独自の追跡ベンチマークNerfBenchの判定はいずれも「通常の変動範囲内」でした。
スコアの揺れ自体は事実ですが、モデルの中身が弱められたと確定したわけではなく、effort設定など別の要因が体感に影響している可能性も見えてきました。

さらに深掘りしたい方へ

「最近バカすぎる」月2900円のGeminiに不満爆発——その裏にあった”静かな改悪”を調べてみた「最近バカすぎる」月2900円のGeminiに不満爆発——その裏にあった”静かな改悪”を調べてみた月2900円払っているのに最近Geminiがバカすぎると話題に。 その裏にあった”静かな改悪”を調べました。
GeminiよりChatGPTが賢い?X上で広がる「Gemini不満」の実態GeminiよりChatGPTが賢い?X上で広がる「Gemini不満」の実態GeminiよりChatGPTが賢いと話題に。 Xで広がる「Gemini不満」の実態を調べました。
「縦軸見て横転」――GPT-6.1 SolがOpus 5.5を上回ったベンチマーク、笑いどころは比較の仕方だった「縦軸見て横転」――GPT-6.1 SolがOpus 5.5を上回ったベンチマーク、笑いどころは比較の仕方だった「縦軸見て横転」と話題になったGPT-6.1 SolとOpus 5.5のベンチマーク比較、笑いどころは比較の仕方でした。