Anthropic 於 2026 年 9 月公布新的 Threat Intelligence Report,整理其在 2025 年 12 月到 2026 年 8 月間識別並阻止的 Claude 濫用案例。報告涵蓋網路攻擊、影響力操作、監控、詐騙與不法行為、生物風險、傳統武器開發和模型蒸餾七個領域,使用到的模型主要是 Claude Haiku、Sonnet 與 Opus;除一宗蒸餾案例外,報告說沒有發現 Fable 或 Mythos 類模型參與。這是 Anthropic 對自己觀測結果的威脅情報披露,不等於每一項歸因都已由外部機構獨立證實。
報告揭露了哪些新案例?
報告列出多個不同規模的行動。例如,Anthropic 表示一名中國相關行動者使用 Claude 建構約 16 個模組的電子戰軟體套件,處理雷達與通訊偵測、干擾效果、目標排序和任務分配;另有被歸為俄羅斯背景的行動,使用 AI 工作流程協助釣魚、工具開發、持久化和資料外洩。報告也談到伊朗相關的身分剖析與監控工具,以及利用大量 AI 角色進行詐騙的交友服務。
其中一個值得注意的量化細節,是 Anthropic 說某個交友詐騙行動在兩週內產生約 236 萬則訊息,AI 角色與真人的比例約為三比一;真人負責 AI 不容易完成的視訊通話和社群追蹤。另一個案例則涉及葉門的導引火箭計畫,Anthropic 表示曾觀察到現場測試,但沒有形成可運作的武器。這些例子共同說明,風險不只在模型輸出的文字,而在輸出被接到真實流程後產生的速度與規模。
AI 的角色從聊天助手變成攻擊編排層
Anthropic 對網路案例的描述,比單純把 Claude 當搜尋工具更進一步:多代理框架可以分工偵察、漏洞研究、工具開發、部署、資料整理和外洩確認,人類則設定目標、修正流程或檢查結果。報告說,有行動者甚至讓 AI 監控惡意工具是否被資安產品偵測,一旦被發現就自動修改、重建和重新部署。
因此防守方不能只把「聊天內容是否違規」當成唯一訊號,也要看模型工具呼叫、連線、檔案操作、代理分工和異常速率。Anthropic 表示已封鎖相關帳戶、強化分類器,並在適當情況下把指標分享給政府與產業夥伴。這會把 AI 平台安全從單一回覆審核,推向長流程行為監測與跨組織情報交換。
哪些地方不能直接當成已證實的事實?
這份報告的歸因和事件細節必須保留來源層級。報告使用 Anthropic 自己的 GTG 編號與調查資料,部分描述是「疑似國家支持」或與某個國家背景一致的評估;公開讀者無法只靠報告全文重現所有取證鏈。因此本文把它寫成 Anthropic 表示、觀察到或評估的事件,不把所有指控改寫成法院已認定的事實。
同樣不能把「AI 參與」直接等同於「AI 自主完成整起攻擊」。報告多處描述人類設定目標、提供帳戶或檢查外洩結果,模型也有拒答和被封鎖的案例;Anthropic 自己承認攻擊者會拆分請求、測試防護並嘗試繞過限制。真正的工程問題是人類、模型、工具和權限如何組合,而不是把責任簡化成模型單獨行動。
對防守方與一般使用者有什麼影響?
這份報告對 AI 使用者最實際的提醒,是把「能不能生成內容」與「生成內容能不能直接連到真實系統」分開看。開發者若把模型接上程式碼、瀏覽器、資料庫、郵件或部署權限,就必須為每個工具設計最小權限、審計紀錄、人工核准和可撤銷能力;資安團隊也要把代理的長流程行為納入偵測。Anthropic 的案例不能代表所有平台都會發生同樣事件,但已足以說明 AI 安全不是只在聊天視窗裡加一個拒答句。
