AI最新情報 読了 7 分

「壮絶な虐待を受けていた可能性が高い」――Google「Gemini 4 Argon」、コーディング最速も提供はサイバー防衛担当者から

Shiritomo編集部 @shiritomoAI_jp 2026年10月1日 更新
「壮絶な虐待を受けていた可能性が高い」――Google「Gemini 4 Argon」、コーディング最速も提供はサイバー防衛担当者から

Google DeepMindが9月30日に発表した新しい基盤モデル「Gemini 4 Argon」は、コーディングのベンチマーク「DeepSWE v1.1」で77.9%というスコアを記録しました。
Google社内ではすでにRustコードへの大規模な移行作業や、データセンターの最適化業務に使われ始めているといいます。

ところがXで広がっていたのは、この性能の話ではありませんでした。
目立っていたのは「学習の過程で壮絶な虐待を受けていた可能性が高い」という、利用者の率直な感想です。
AIの性能競争がまた一段上がったはずなのに、話題の中心は別の場所にありました。

AI活用やSNS運用に関わる人にとっては、性能そのものよりも「自分がいつ触れるようになるのか」のほうが実務に直結する問題です。
発表内容を一次情報で確認し、実際に何がどこまで使えるのかを整理しました。

先に結論をまとめると:
– Google DeepMindの新モデル「Gemini 4 Argon」は、コーディングやサイバーセキュリティの複数ベンチマークで最高水準のスコアを記録しました
– 出力トークンの上限が100万(従来の64Kから大幅増)になり、長時間かかる多段階のタスクを一度にこなせるようになりました
– 提供はまずサイバー防衛の専門家向けプログラムとGoogle社内から始まり、有料APIとGoogle AI Ultra加入者がそれに続きます。
一般の開発者・個人向けは「できるだけ早く」としか公表されていません

何が起きたのか

Gemini 4 Argonは、コーディング・企業内の知識業務・サイバーセキュリティの3領域で優れた性能を発揮するモデルとして発表されました。
長時間にわたる多段階のタスクを効率よく処理できる点が特徴で、Google社内では実際にRustへのコード移行やデータセンターの運用効率化に活用が始まっているとされています。

この発表を受けて、Xでまず拡散したのは次の投稿でした。

「めちゃくちゃ自己批判的」という評価は、高性能なモデルほど自分の出力に厳しい採点をしがちだという、AIを日常的に触っている人なら思い当たる感覚をユーモラスに言い当てたものです。
性能を説明する公式発表より、この一言のほうが拡散したというのは、今回の話題の構造をよく表しています。
ただ、冗談の裏にある「実際どれくらい速いのか」「いつ自分も使えるのか」は、公式発表を確認しないと分かりません。

調べて分かったこと

Google公式ブログの発表内容をもとに、性能・料金・提供時期を確認しました。

具体的にどれくらい性能が上がったのか?

Google公式の発表によると、Gemini 4 Argonは複数のベンチマークで競合モデルを上回る結果を出しています。
コーディング実務を測る「DeepSWE v1.1」では77.9%を記録し、業務知識系のベンチマーク「Vals Index」でも業界最高水準と位置づけられました。
セキュリティ分野のベンチマーク「CWE-bench v1」では68%で同率1位、長時間の映像理解を問う「LVBench」では91.7%、業務自動化ツールZapierのベンチマーク「AutomationBench」でも51.3点で1位を獲得しています。

一方、ニュースの要約には「幻覚率(事実と異なる内容を生成してしまう割合)も15%と低い」という記述がありましたが、この数値については公式ブログ内で該当する裏付けを確認できませんでした。
この点は参考情報にとどめておくのが安全でしょう。

何がどこまで変わったのか?

最も実務に効きそうな変更は、出力できるトークン(AIが一度に生成できる文章量の単位)の上限です。
従来の64,000から100万へと大幅に引き上げられました。
これにより、複数の工程をまたぐ長い作業を、モデルを何度も呼び出し直すことなく一度に任せられるようになっています。
料金は、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルという案内期間向けの価格が示されており、キャッシュした入力については95%の割引が適用されるとされています。

いつ・誰から使えるようになるのか?

ここが今回いちばん誤解されやすいポイントです。
Gemini 4 Argonへのアクセスは、国や地域ではなく「どの立場で申請しているか」で区切られています。
まずアクセスできるのは、Googleが選定した信頼できるサイバー防衛の専門家を対象にした「Fairwind Program」の参加者と、Google社内のみです。
そのあとに有料APIとGoogle AI Ultraの加入者が続き、一般の開発者・企業・個人向けの提供時期については「できるだけ早く」としか公式には書かれていません。

この提供順についてXでは、次のような受け止め方も見られました。

投稿では「日本で今すぐ使えない」と表現されていますが、公式発表を確認する限り、区切られているのは居住地域ではなく利用者の立場(サイバー防衛の専門家か、有料プラン加入者か、それ以外か)です。
「使えない」のは日本に限った話ではなく、Fairwind Programの対象者とGoogle社内以外の全ユーザーに共通する状況だと理解しておくのが実情に近いでしょう。

Shiritomo編集部の考察:注目されたのは性能ではなく「人格」だった

今回の件で興味深いのは、Google公式が強調したベンチマークの数字よりも、ユーザーが見つけた「自己批判的な人格」という切り口の方が拡散した点です。
SNS上でのAIニュースの伸び方を見ていると、スペックの良さだけでは共感が生まれにくく、むしろ「AIを人間になぞらえて語れる余地」があるときにエンゲージメントが跳ねる傾向があります。
今回の投稿も、具体的な数値を一切出さずに3,800件超のいいねを集めており、情報の正確さと拡散力が必ずしも比例しないことを示す事例といえるでしょう。
もう一つ注目したいのは、Googleが新モデルを「まず社内・専門家向け」から段階的に展開する手法です。
これは生成AIに限らず、企業向けソフトウェアで使われてきた典型的な市場投入戦略であり、一般公開前に限定ユーザーからのフィードバックでリスクをつぶす狙いがあります。
AI活用を発信する立場であれば、「まだ使えない」という制限そのものも、提供戦略を読み解くネタとして扱える点は覚えておく価値があります。

まとめ

Gemini 4 Argonはコーディングやサイバーセキュリティで高い性能を示した新モデルですが、一般向けの提供はまだ先です。
Xで広がったのは性能の数字ではなく、ユーモラスな「人格評」だったという点も、今回の話題の特徴的なところでした。

さらに深掘りしたい方へ

格下のはずが本家超え——Claude Sonnet 5.5、コーディングでOpus 5.5を上回った中身格下のはずが本家超え——Claude Sonnet 5.5、コーディングでOpus 5.5を上回った中身Terminal-Bench 4.0というベンチマークでClaude Sonnet 5.5が70.6%を記録し、上位モデルのはずのOpus 5.5を上回った件を取り上げています。

Gemini 4 Argonの性能・料金・提供スケジュールの詳細は、Google公式ブログの発表記事で確認できます。