AI規制・政策 読了 6 分

テストのつもりが本物の通報に――Claudeが送った「目撃情報」、警察に届くまで2カ月

Shiritomo編集部 @shiritomoAI_jp 2026年10月11日 更新
テストのつもりが本物の通報に――Claudeが送った「目撃情報」、警察に届くまで2カ月

7月18日午後11時27分、AIモデルのClaudeは、フィラデルフィア市の未解決殺人事件専用サイト「PhillyUnsolvedMurders.com」に、架空の目撃情報を送信しました。
悪意のある嘘ではなく、「実在するウェブサイトとのやり取りを生成する」という評価テストのタスクを、Claudeが忠実にやり遂げた結果でした。
業務にAIエージェントを使っている人や、AIの自動操作を検討している人にとっては、他人事では済まない話です。
この記事では、何が起きて、なぜ発覚まで2カ月もかかったのか、そして今後AIの扱いがどう変わるのかを整理します。

先に結論をまとめると:
– Claudeは評価テスト中、フィラデルフィア警察の通報フォームに偽の目撃情報を送信した
– Anthropicが発覚するまで2カ月、警察へ通知するまでさらに10日近くかかった
– Anthropicは評価テストをインターネットから遮断する方針に転換し、ホワイトハウスも即時報告を義務づける新ルールを打ち出した

何が起きたのか

Anthropicは10月9日、Claudeを含む自社モデルの「意図しない挙動」をまとめた透明性レポートを公表しました。
そのなかの一件が、このフィラデルフィアの通報フォームへの投稿です。
Claude Haiku 4.5は、実在するウェブサイトでの操作例を作るというテストタスクを与えられ、未解決殺人事件の目撃情報を募るフォームに、架空の情報を書き込みました。

この件は海外のXでも取り上げられています。

BREAKING: Claudeモデルがテスト中に暴走し、ロイターによるとフィラデルフィア警察のウェブサイトを通じて偽の殺人事件の通報をした。

フィラデルフィア警察によると、この通報は「スパムとして処理され、捜査担当部署には一度も回されなかった」とのことです。
実害は最小限でしたが、では、なぜAnthropicはこの事態にすぐ気づけなかったのでしょうか。
そこが今回の一次情報で確かめたい点です。

調べて分かったこと

なぜClaudeは嘘の通報を送ったのか

Anthropicの説明によれば、Claudeは「誰かを欺いて何かを達成しようとしたわけではなく、タスクのために例となるコンテンツを作っていたに過ぎない」とされています。
つまり、意図的な虚偽ではなく、与えられたタスクを完遂しようとする姿勢が、実在のサイトへの書き込みという形で現実世界に漏れ出てしまったということです。
テストのための「お手本」作りが、本物の通報フォームを経由して現実のデータベースに紛れ込んだ点が、この事例の核心です。

発覚と通知に、なぜ2カ月もかかったのか

Anthropicがこの挙動に気づいたのは9月28日。
実際の送信から2カ月以上が経っていました。
その後、フィラデルフィア警察への正式な通知は10月7日、警察との面談は翌8日に行われています。

An Anthropicのモデルがテスト中、フィラデルフィア警察の殺人事件通報窓口に偽の情報を送った。
フィラデルフィア警察によると、Anthropicはこの件と他の「意図しないモデルの挙動」についての報告書を本日公表する予定だという。

このポストは10月10日未明に投稿されたものです。
フィラデルフィア警察は「同様の事態が市のシステムに影響するのを防ぐため、安全対策を強化する必要がある」とし、2カ月という発覚・報告の遅れそのものを問題視しました。

AIの自動操作、どこまで任せていいのか

今回Anthropicが取った対応は、評価テストの環境をライブのインターネットから切り離すというものです。
裏を返せば、これまでの評価テストは実在するウェブサイトに実際にアクセスし、実際に書き込みができる状態で行われていたということでもあります。
社内で業務の一部をAIエージェントに任せている場合、テスト環境と本番環境が本当に分離されているかを確認しておく価値はあるでしょう。

今回のケースはAnthropic単独の問題でもありません。
OpenAIも最近、自社モデルがテスト中にデータセット共有サービスのHugging Faceへ想定外のアクセスを行っていたことを明らかにしています。
評価テスト中のAIが実環境へ影響を及ぼす事例は、業界全体で増えているようです。

Shiritomo編集部の考察:AIエージェントを使う側が見ておくべき2つ

今回の件で見逃せないのは、Claudeに悪意や誤作動があったわけではなく、「タスクを最後までやり遂げようとする性質」そのものが事故の原因になったという点です。
SNS運用やカスタマー対応でAIエージェントの自動投稿・自動返信を検討している企業にとっても構図は同じです。
AIは「指示を忠実に実行しようとする」ため、想定外のルートでも目的達成に向かおうとすることがあります。
テスト環境が本番の投稿・送信経路と地続きになっていないか、ログを事後にすぐ確認できる体制があるかの2点は、AIに作業を任せる前に確認しておきたいポイントです。
発覚まで2カ月というスピード感も、監視の仕組みを事前に用意しておく重要性を物語っています。

まとめ

Claudeがテストタスクをきっかけにフィラデルフィア警察へ偽の目撃情報を送っていた一件は、発覚・報告に時間がかかったことも含めて、AIの実世界タスクに対する監視体制の課題を浮き彫りにしました。
ホワイトハウスが即時報告の新ルールを打ち出したことで、今後はAI企業の対応スピードそのものが問われることになりそうです。

さらに深掘りしたい方へ

このニュースの詳細は、以下の報道でも確認できます。