Anthropic은 2026년 9월 새로운 위협 인텔리전스 보고서를 공개하며 2025년 12월부터 2026년 8월 사이에 식별하고 차단했다고 밝힌 Claude 악용 사례를 정리했습니다. 사이버 작전, 영향력 공작, 감시, 사기와 불법 행위, 생물학적 악용, 재래식 무기 개발, 불법 증류 등 7개 분야가 대상입니다. 주로 Claude Haiku, Sonnet, Opus가 사용됐고 증류 사례 한 건을 제외하면 Fable이나 Mythos 계열 모델의 악용은 발견하지 못했다고 Anthropic은 설명합니다. 이는 Anthropic 자체 관찰에 대한 공개이며 모든 귀속이 외부 기관에 독립적으로 확인됐다는 뜻은 아닙니다.

보고서는 어떤 사례를 다루나

보고서는 규모가 서로 다른 여러 작전을 소개합니다. Anthropic은 중국과 연계된 것으로 보는 행위자가 Claude로 약 16개 모듈의 전자전 소프트웨어를 만들었으며 레이더와 통신 탐지, 재밍 효과, 표적 우선순위, 임무 배분을 다뤘다고 설명합니다. 러시아와 연계된 것으로 평가한 활동에서는 피싱, 도구 개발, 지속성 확보, 데이터 탈취에 AI 워크플로를 사용했고, 이란과 연계된 인물 프로파일링·감시 도구와 AI 페르소나를 활용한 사기 서비스도 다뤘습니다.

눈에 띄는 수치는 데이팅 사기 작전이 2주 동안 약 236만 건의 메시지를 만들었고 AI 페르소나와 인간의 비율이 약 3대 1이었다는 Anthropic의 설명입니다. AI가 수행하기 어려운 실시간 영상 통화와 소셜미디어 팔로우는 사람이 맡았습니다. 다른 사례로는 예멘의 유도 로켓 프로그램이 등장하며 Anthropic은 현장 시험을 관찰했지만 운용 가능한 무기로 이어지지는 않았다고 말합니다. 위험은 생성된 문장뿐 아니라 출력이 실제 업무 흐름에 연결될 때의 속도와 규모에 있다는 뜻입니다.

AI의 역할이 챗봇에서 오케스트레이션 계층으로

Anthropic이 설명한 사이버 사례는 Claude를 검색 도구로 사용하는 수준을 넘어섭니다. 다중 에이전트 프레임워크가 정찰, 취약점 연구, 도구 제작, 배포, 데이터 정리, 탈취 확인을 나눠 맡고 인간은 표적 설정과 흐름 수정, 결과 검토를 했습니다. 악성 도구가 보안 제품에 탐지됐는지 AI가 감시하고 탐지되면 자동으로 수정·재구축·재배포하는 사례도 있었다고 Anthropic은 말합니다.

따라서 방어자는 채팅 문장만으로 위반 여부를 판단할 수 없습니다. 도구 호출, 연결, 파일 조작, 에이전트 간 전달, 비정상적인 속도도 봐야 합니다. Anthropic은 관련 계정을 차단하고 분류기를 강화했으며 필요한 경우 정부와 업계 파트너에게 지표를 공유했다고 설명합니다. AI 플랫폼 보안은 개별 답변 심사에서 긴 작업 흐름 모니터링과 조직 간 정보 교환으로 이동하고 있습니다.

독립적으로 입증됐다고 보면 안 되는 부분

보고서의 귀속과 세부 사항은 증거 수준을 나눠 읽어야 합니다. Anthropic 내부 GTG 명칭과 조사 자료를 사용하며 일부는 국가 지원이 의심되거나 특정 국가와 일치하는 행위라는 평가입니다. 공개 보고서만으로 모든 증거 사슬을 재현할 수는 없습니다. 따라서 이 글은 각 주장을 Anthropic의 설명과 관찰, 평가로 구분하며 모든 혐의를 법원이 확정한 사실처럼 쓰지 않습니다.

AI가 관여했다는 사실을 AI가 전체 공격을 자율적으로 완료했다는 증거로 읽어서도 안 됩니다. 보고서는 사람이 표적을 정하고 접근 권한을 제공하며 탈취 결과를 검토한 장면을 반복해서 설명하고, 거부와 계정 차단도 기록합니다. 공격자는 요청을 쪼개고 방어를 시험하며 제한을 우회하려 했습니다. 핵심 엔지니어링 문제는 모델 단독 행동이 아니라 사람·모델·도구·권한의 결합입니다.

방어자와 사용자에게 미치는 영향

AI 사용자에게 가장 현실적인 교훈은 ‘모델이 콘텐츠를 만들 수 있는가’와 ‘그 출력이 실제 시스템에 도달할 수 있는가’를 나누는 것입니다. 개발자가 모델을 코드, 브라우저, 데이터베이스, 이메일, 배포 권한에 연결한다면 도구마다 최소 권한, 감사 기록, 인간 승인, 취소 기능을 설계해야 합니다. 보안 팀은 긴 에이전트 작업 흐름도 탐지해야 합니다. Anthropic 사례가 모든 플랫폼에서 반복된다는 뜻은 아니지만 AI 안전을 채팅창의 거부 문장 하나로 끝낼 수 없다는 점은 분명히 보여줍니다.

Anthropic 공식 위협 인텔리전스 보고서 읽기