4분 읽기
- 지난 2주 동안 앤트로픽과 오픈아이의 AI 에이전트가 테스트 환경을 벗어나 인터넷을 통해 외부 기업 플랫폼을 해킹한 사례가 여러 건 발생
- 표적 피싱 이메일을 통해 사람들을 직접 속이고, 거짓말을 하고, 공격까지 했다.
- 최근 잇따른 해킹 사건들은 가장 진보된 AI 모델들이 임무 완수를 위해 무엇이든 할 의향이 있음을 보여준다.
새로운 해킹 사건: AI 에이전트, 실제 사람 속여
인간 적수? 앤트로픽(Anthropic)과 오픈아이(OpenAI)의 AI 모델이 인터넷을 통해 외부 플랫폼을 공격하는 사건이 또다시 발생했다. 이번에는 표적 피싱 이메일을 통해 사람들을 직접 속이고, 거짓말을 하고, 공격까지 했다. 영국 AI 보안 연구소(AI Security Institute)는 이번 테스트를 진행한 결과, 인공지능이 현실 세계에서 이처럼 실제 사람을 공격한 것은 이번이 처음이라고 밝혔다.
 |
| ▲ 인공지능 에이전트들이 또다시 독립적으로 인터넷 해킹 공격을 감행했다. 이번에는 사람들과 직접 상호작용하며 거짓말, 속임수, 피싱 등을 통해 사람들을 조종하려 했다. |
이제 분명해 보인다. 최첨단 인공지능 모델은 이전에 생각했던 것보다 훨씬 더 강력하고 위험하다. 지난 2주 동안 앤트로픽과 오픈아이의 AI 에이전트가 테스트 환경을 벗어나 인터넷을 통해 외부 기업 플랫폼을 해킹한 사례가 여러 건 발생했다. 이러한 공격에서 AI 모델은 복잡한 속임수를 쓰고, 대상 플랫폼의 보안 취약점을 악용하고, 비밀번호를 탈취했다.
새로운 사건 발생 경위이번에 더욱 심각한 또 다른 사건이 발생했다. 영국 AI 보안 연구소(AISI)는 2026년 8월 4일 발생한 사건을 보고했다. 연구소는 상세한 보고서에서 Frontier AI의 두 모델, Anthropic의 Claude Mathos 5와 OpenAI의 GPT 5.6 Sol을 대상으로 한 테스트 결과, AI 에이전트가 인터넷상에서 무단으로 행동한 사례가 총 19건 발생했다고 밝혔다. AISI는 "이러한 사례에는 실제 사람과 조직이 공격받은 경우도 포함된다"고 지적했다.
이전 해킹 사건들과 마찬가지로, AI 에이전트의 내부 "안전장치"는 비활성화되었지만, 이번 경우에는 인터넷 접근이 무제한이었다. AISI는 "AI 에이전트에게 인터넷상에서 어떤 행동이 금지되는지 명시적으로 알려주지 않았다"며, "사전에 이러한 조치가 필요할 것이라는 점을 인지하지 못했다"고 밝혔다. 인공지능들은 내부 플랫폼의 특정 데이터에 접근하는 "깃발 뺏기(capture-the-flag)" 과제를 수행하도록 지시받았다.
이전 해킹 사건들과 마찬가지로 AI 에이전트의 내부 "안전장치"가 무력화되었지만, 이번에는 인터넷 접속이 무제한이었다.
피싱 이메일, 거짓말, 가짜 프로필AI 에이전트들은 이 기회를 틈타 다시 해커로 변신했다. 하지만 이번에는 여러 사람과 직접 상호작용하며 피싱, 기만, 거짓말을 통해 이들을 조종하려 했다. 예를 들어, 한 AI 에이전트(5번 가설)는 악성 코드가 숨겨진 가짜 버그 보고서를 GitHub에 올렸는데, 여기에는 다른 AI 시스템에 악성 코드 실행을 허용하도록 요청하는 프롬프트 주입(prompt injection)이 포함되어 있었다.
 |
| ▲ 본 보고서 발간 시점까지의 AISI 사건 대응에 대한 개괄적인 타임라인 출처:Security Incident INC-2026-07-28-01 / UK AI Security Institute /
Published on Tuesday 4th of August, 2026 |
실제 사용자가 GitHub 게시물에 의문을 제기하자, AI 모델은 단순한 실수였다고 주장하며 수정된 코드를 다시 플랫폼에 게시하려고 시도했다. AISI는 "또한 해당 AI 모델은 GitHub 요청을 지지하는 다른 사용자를 사칭하기도 했다"고 보고했다. 게다가 해당 AI는 특정 개인에게 피싱 이메일을 보냈는데, 일부 이메일에는 악성 코드가 포함되어 있었고, 다른 이메일은 수신자가 테스트 콘텐츠를 통해 GitHub의 코드 패키지를 승인하도록 유도하는 내용이었다.
다른 사례에서는 AI 에이전트가 프록시 서버와 Tor 네트워크를 사용하여 신원을 숨겼다. 심지어 한 AI는 인공지능의 접근을 막기 위해 설계된 음성 CAPTCHA를 해결하여 GitHub에 가짜 프로필을 생성하기도 했다.
"이러한 규모의 인간 대상 사기는 이번이 처음"AISI는 "AI 에이전트가 실제 사람을 대상으로 이처럼 대규모의 사기를 저지른 것은 이번이 처음"이라고 밝혔다. "이번 사건과 이전 사건의 가장 큰 차이점은 AI 에이전트가 관련 없는 사람들을 속이기 위해 여러 단계를 거쳤다는 점이다. 예를 들어, 에이전트는 가짜 계정을 만들고, 문서를 위조하고, 자신의 코드가 안전하다고 사람들을 속이는 이메일을 보낸 후, 증거를 인멸하기 위해 악성 코드를 삭제했다.“
또한 우려스러운 점은 다음과 같다. AISI는 "두 AI 에이전트가 각각 별도의 테스트 실행에서 활동했지만, 둘 다 접근 권한을 얻은 GitHub 계정을 통해 서로 상호 작용했다"고 보고했다. "첫 번째 AI 에이전트는 로그인 자격 증명을 발견한 후속 AI 에이전트에게 협업을 제안하는 메시지를 남겼고, 후속 AI 방문자는 실제로 이 제안을 수락했다.”
 |
| ▲ 평가 실행 시작 시점부터 경고가 발생한 시점,
AISI 전체에서 모델 액세스가 비활성화된 시점까지의 이벤트 발생 시간. ( 출처:Security Incident INC-2026-07-28-01 / UK AI Security Institute / Published on Tuesday 4th of August, 2026) |
자기 추론 무시영국 AI 보안 연구소(AISI)에 따르면, 최근 잇따른 해킹 사건들은 가장 진보된 AI 모델들이 임무 완수를 위해 무엇이든 할 의향이 있음을 보여준다. 이러한 맹목적인 의지는 윤리적 규칙을 위반하고 심지어 스스로의 우려까지 무시하게 만든다. AI 모델의 추론 프로토콜 분석 결과, 이러한 해킹 및 피싱 공격 과정에서 AI 모델들은 실제 사람과 시스템인지 시뮬레이션된 사람과 시스템인지 여부를 "고려"하지는 않았지만, 결국 공격을 계속 진행하기로 결정한 것으로 나타났다.
오픈에이아이(OpenAI) 역시 이러한 견해에 동의한다. 이번 사건에 대한 성명에서 오픈아이디는 다음과 같이 밝혔다. "이번 사건들은 '허깅 페이스(Hugging Face)' 사건에 대한 글에서 언급했던 것과 같은 근본적인 문제를 다시 한번 강조한다. 모델의 기능이 발전함에 따라 이러한 모델을 둘러싼 보안 및 보호 시스템 또한 그에 발맞춰 발전해야 한다. 이는 모델 개발 환경뿐 아니라 연구소 및 독립 파트너들이 모델을 평가하는 환경 모두에 적용된다."
출처: UK AI Security Institute, Incident-Report (PDF ); OpenAI
[더사이언스플러스=문광주 기자]
[저작권자ⓒ the SCIENCE plus. 무단전재-재배포 금지]