Anthropicは2026年9月、2025年12月から2026年8月までに特定・阻止したとするClaudeの悪用事例をまとめた脅威インテリジェンス報告を公開しました。サイバー作戦、影響工作、監視、詐欺・不正行為、生物学的悪用、通常兵器開発、違法な蒸留の7分野を扱い、主にClaude Haiku、Sonnet、Opusが使われたと説明しています。蒸留の1件を除き、FableやMythosクラスの悪用は確認していないとしています。これはAnthropic自身の観測に基づく開示であり、すべての帰属が外部機関に独立検証されたという意味ではありません。

報告はどんな事例を扱うのか

報告には規模の異なる複数の作戦が登場します。Anthropicは、中国に関連するとみる行動者がClaudeで約16モジュールの電子戦ソフトウェアを構築し、レーダー・通信の検知、妨害効果、標的の優先順位、任務配分を扱ったと説明しています。ロシア関連と評価する活動では、フィッシング、ツール開発、永続化、データ窃取にAIワークフローを使ったとし、イラン関連の人物プロファイリングや監視ツール、AI人格を使った詐欺サービスも取り上げています。

数値として目を引くのは、交際詐欺の作戦で2週間に約236万件のメッセージが生成され、AI人格と人間の比率が約3対1だったという説明です。AIが難しいライブビデオ通話やSNSのフォローを人間が担当しました。別の事例ではイエメンの誘導ロケット計画について、現地試験を観測したものの、運用可能な兵器には至らなかったとしています。リスクは生成文だけでなく、出力を現実の業務につないだときの速度と規模にあります。

AIの役割はチャットボットから編成層へ

Anthropicが示すサイバー事例は、Claudeを検索ツールとして使う段階を超えています。マルチエージェントの枠組みが偵察、脆弱性研究、ツール開発、展開、データ整理、窃取確認を分担し、人間は標的の設定、ワークフローの修正、結果の確認を行いました。悪性ツールがセキュリティ製品に検出されたかをAIが監視し、検出後に自動で修正、再構築、再展開する例もあったとしています。

防御側は、チャットの文面だけを違反判定の手がかりにできません。ツール呼び出し、接続、ファイル操作、エージェント間の引き継ぎ、異常な速度も見る必要があります。Anthropicは関連アカウントを停止し、分類器を強化し、適切な場合には政府や業界パートナーと指標を共有したと説明しています。AIプラットフォームの安全対策は、個々の回答の審査から長い処理フローの監視と組織間の情報共有へ移りつつあります。

独立検証済みと扱えない点は何か

報告の帰属と細部は、証拠のレベルを分けて読む必要があります。Anthropic独自のGTG番号と調査データを使い、一部は国家支援が疑われる活動、または特定国との関連に整合する手口という評価です。公開報告だけで全ての取材・技術的証拠を再現できるわけではありません。本稿ではAnthropicの説明、観測、評価として記述し、裁判所が認定した事実のように断定しません。

AIが関与したことを、AIが攻撃全体を自律的に完遂した証拠と読むこともできません。報告では人間が標的を設定し、アカウントを用意し、窃取結果を確認する場面が繰り返し出てきます。拒否やアカウント停止も記録されています。攻撃者は依頼を分割し、防御を試し、制限回避を試みました。問われているのはモデル単体ではなく、人、モデル、ツール、権限の組み合わせです。

防御側と利用者への影響

AI利用者にとっての実践的な教訓は、「モデルが内容を生成できるか」と「その出力が現実のシステムへ届くか」を分けることです。コード、ブラウザー、データベース、メール、展開権限にモデルを接続するなら、各ツールに最小権限、監査ログ、人の承認、取り消し可能性を設計する必要があります。Anthropicの事例が全てのサービスで再現するわけではありませんが、AI安全はチャット画面の拒否文だけでは足りないことを示しています。

Anthropic公式の脅威インテリジェンス報告を読む