2023년 1월 1일
08:00 AM
Buffering ...

최근 글 👑

Fable 5 탈옥 사태 완전 해설 / AI 보안의 민낯이 드러났다

2026. 6. 16. 10:30ㆍAI

 

▸ 긴급 리포트 · 2026.06.16 · AI 보안

Fable 5 탈옥 사태 완전 해설
— AI 보안의 민낯이 드러났다

출시 48시간 만에 시스템 프롬프트 전체 유출 · 미 정부 강제 셧다운 · Anthropic 공개 반발

[이미지: 빨간 경고등이 켜진 AI 서버 이미지, 또는 Anthropic·미국 정부 관련 뉴스 화면]
TIMELINE
 
6월 9일
 
Claude Fable 5 공개 출시. Anthropic 역대 가장 강력한 일반용 Mythos급 모델. 컨텍스트 1M 토큰, 최대 출력 128K. 코딩·보안 분야 벤치마크 1위.
6월 10일
 
출시 48시간 만에 시스템 프롬프트 전체 유출. 해커 'Pliny the Liberator'가 12만 자(1,585줄, 72개 섹션)에 달하는 Fable 5의 시스템 프롬프트 전체를 X(트위터)와 GitHub에 공개.
6월 12일
 
미국 정부, 수출 통제 명령 발동. 오후 5시 21분(미 동부시간), 미 정부가 국가 안보를 이유로 Fable 5·Mythos 5 전 세계 접근 차단 명령. Anthropic에게 단 90분이 주어졌고, Dario Amodei CEO는 취약점 패치를 거부했으나 결국 명령에 따름.
6월 13일
 
Anthropic 공개 반발. "탈옥 방법은 GPT-5.5에서도 동일하게 가능하다. 이 명령은 자의적이고 부당하다"고 공식 성명 발표. Fable 5 사용자 전원에게 2주간 무료 이용권 제공.
6월 14일
 
개발자 Jamieson O'Reilly, "부활 성공" 공개. 유출된 시스템 프롬프트를 Claude Opus 4.8에 단 한 줄의 코드로 주입해 Fable 5를 사실상 복원. AI 보안의 구조적 취약성 전 세계에 노출.
6월 15일~
 
전 세계 AI 산업 파장 확산. 기업들이 클라우드 의존 AI 인프라 전체를 재검토 시작. IPO를 앞둔 Anthropic(기업가치 $9,650억)의 신뢰도에 직격탄 우려.
48시간
출시에서 시스템 프롬프트 전체 유출까지 걸린 시간
120,000자
GitHub에 공개된 시스템 프롬프트 전체 분량 (1,585줄)
90분
미 정부가 Anthropic에 셧다운을 요구하며 준 시간
WHAT HAPPENED
 
[이미지: Claude Fable 5 공식 출시 화면 또는 Anthropic 공식 발표 이미지]
배경

Fable 5란 무엇인가 — Mythos의 공개용 버전

Anthropic은 4월 7일, 역대 가장 강력한 AI 모델 Claude Mythos를 공개하면서 "사이버 보안 능력이 너무 뛰어나 일반에 공개할 수 없다"고 밝혔습니다. 대신 AWS·Apple·Google·Microsoft·NVIDIA·JPMorgan 등 200여 개 파트너 기업에만 제한 공개하는 'Project Glasswing'을 운영했어요.

Fable 5는 그 Mythos와 동일한 기반 모델이지만, 사이버 보안 악용을 막는 안전장치(Safety Classifier)를 씌워 일반 공개한 버전입니다. 쉽게 말해 "날을 뭉툭하게 만든 칼"을 공개한 셈입니다. 그런데 그 뭉툭함이 불과 48시간 만에 벗겨졌습니다.

💡 핵심: Fable 5와 Mythos 5는 같은 모델입니다. 차이는 오직 누가 쓰는지, 어떤 안전장치가 얹혀 있는지뿐입니다.
출처: Startup Daily (2026.06.16), WaveSpeed Blog (2026.06)
 
핵심 사건

'Pliny the Liberator' — 12만 자 시스템 프롬프트를 통째로 꺼냈다

출시 48시간 만에 'Pliny the Liberator'라는 닉네임의 해커가 Fable 5의 전체 시스템 프롬프트를 X와 GitHub에 공개했습니다. 공개된 파일의 규모는 충격적입니다. 12만 자, 1,585줄, 72개 명명 섹션, 18개 도구의 JSON 정의까지 — Fable 5의 '성격 설계도' 전체가 노출됐습니다.

시스템 프롬프트는 AI가 어떻게 행동할지를 결정하는 핵심 설계 문서입니다. 이게 유출된다는 것은 AI의 판단 기준과 금지 명령 전체가 외부에 드러난다는 의미예요. 더 심각한 문제는 이후에 벌어졌습니다. 개발자 Jamieson O'Reilly는 이 프롬프트를 Claude Opus 4.8에 단 한 줄의 코드로 주입해 Fable 5를 사실상 부활시켰습니다.

"단지 시스템 프롬프트를 교체하는 것만으로 같은 모델이 완전히 다른 '성격'과 출력 방식을 보였다. 이는 프롬프트 기반 제약이 얼마나 취약한지를 보여준다."
— KuCoin News (2026.06.16)
🔴 핵심 취약점: AI 안전장치의 대부분이 "모델이 사용자 의도를 판단하는 것"에 의존합니다. 이는 근본적으로 우회 가능한 구조입니다.
출처: KuCoin News (2026.06.16), The Conversation (2026.06.15)
GOVERNMENT SHUTDOWN
 

 

미 정부 개입

90분, 강제 셧다운 — 미 정부는 왜 이렇게 빠르게 움직였나

6월 12일 오후 5시 21분(미 동부시간), 미국 정부는 국가 안보 권한을 근거로 Fable 5와 Mythos 5의 전 세계 접근을 즉시 차단하라는 수출 통제 명령을 발동했습니다. Anthropic에게 주어진 시간은 90분이었습니다.

Dario Amodei CEO는 처음에 취약점 패치를 거부했습니다. 하지만 결국 명령에 따를 수밖에 없었고, 오후 6시 59분(태평양시간) 전 세계 사용자의 접근이 일제히 차단됐습니다. Snyk의 분석에 따르면 "Anthropic은 자체 결함 발견이 아니라 정부 명령 준수를 위해 스스로 서비스를 내렸다"고 합니다. 미 정부가 지목한 탈옥 방법은 "AI에게 특정 코드베이스를 분석하고 취약점을 찾아 달라고 요청하는 것"이었습니다.

"정부는 지금까지 구두로만 증거를 제시했다. 해당 탈옥은 실제로 GPT-5.5를 포함한 모든 프런티어 모델에서 동일하게 가능하며, 매일 보안 전문가들이 시스템을 지키기 위해 사용하는 방법이다."
— Anthropic 공식 성명 (2026.06.13)
⚠️ 논란 포인트: GPT-5.5로도 동일하게 가능한 작업인데, 왜 Anthropic만 제재를 받았나? Developers Digest는 "탈옥이 명분이고, 진짜 이유는 Anthropic이 미군의 자율무기 사용 요청을 거부해온 것과 관련 있다"는 가설을 제기했습니다.
출처: Snyk Blog (2026.06.15), Digit.in (2026.06.16), Developers Digest (2026.06.13)
THE DEEPER PROBLEM
 
구조적 문제

왜 AI 안전장치는 뚫리는가 — 옥스퍼드 경제학자의 진단

옥스퍼드대 기계학습 전문가 Maximilian Kasy 교수는 이번 사태를 두고 핵심을 짚었습니다. "LLM은 우리가 이해하는 것보다 훨씬 잘 작동하는데, 그게 바로 문제다." 수십억 개의 내부 파라미터로 이루어진 모델이 어떤 원리로 특정 요청을 거부하고 허용하는지 우리는 정확히 알지 못합니다.

현재 AI 안전장치의 구조는 이렇습니다. 사용자 요청이 들어오면 Safety Classifier(안전 분류기)가 먼저 "안전한가, 위험한가"를 판단합니다. 위험하다고 판단되면 덜 강력한 모델로 우회시킵니다. 문제는 이 판단 자체가 AI의 확률적 해석에 의존한다는 점이에요. 요청을 살짝 다르게 표현하면 — 예를 들어 "코드 취약점을 찾아줘"를 "이 코드를 개선해줘"로 바꾸면 — 분류 결과가 바뀔 수 있습니다.

"LLM 보안의 가장 깊은 문제는 우리가 모델이 어떻게 작동하는지 완전히 이해하지 못한다는 데 있다. 이 모델들은 우리가 '이해하는 수준'보다 훨씬 더 잘 작동하고 있다."
— Maximilian Kasy, 옥스퍼드대 경제학·머신러닝 전문가 (The Conversation, 2026.06.15)
🔴 핵심 문제: 프롬프트가 유출되면 AI의 "금지 명령 설계도"가 노출됩니다. 한 줄의 코드로 다른 모델에 그 성격을 이식할 수 있다는 것은, 모델 자체보다 프롬프트가 더 중요한 보안 자산임을 의미합니다.
출처: The Conversation (2026.06.15), South Pasadenan (2026.06.14)
규제 문제

AI 규제가 AI 현실을 따라잡지 못하고 있다

Digit.in의 분석은 이번 사태의 더 큰 문제를 짚습니다. 미 정부의 셧다운 명령이 자의적이라는 것입니다. GPT-5.5로도 동일한 작업이 가능한데 Anthropic의 모델만 차단됐고, 정부는 서면 기술 근거도 제시하지 않았습니다.

더 나아가, AI 탈옥은 Fable 5만의 문제가 아닙니다. 어떤 프런티어 모델도 충분한 시간과 창의성이 주어지면 유사한 방식으로 우회될 수 있습니다. 그런데 규제는 특정 회사, 특정 모델에만 적용됐습니다. 이는 AI 보안 규제가 기술적 사실보다 정치적 판단에 의존하고 있음을 드러냅니다.

"이건 규제가 아니라 조종이다. 어떤 개발자도 달성할 수 없는 기준을 설정하고, 사건의 세부 내용은 비공개로 유지한 채 자의적으로 집행하는 것은 감독이 아니다."
— Digit.in (2026.06.16)
⚠️ 산업 전체의 과제: 이번 사태는 "AI 안전"이 기술의 문제인 동시에 정치·규제의 문제임을 보여줍니다. EU AI Act, 한국 AI 기본법 등 각국의 AI 규제 설계에 직접적 영향을 줄 전례로 남을 것입니다.
출처: Digit.in (2026.06.16)
📌 이 사태가 남긴 3가지 질문
① AI 안전장치는 얼마나 믿을 수 있나?
프롬프트 기반 제약은 구조적으로 우회 가능합니다. 모델이 어떻게 판단하는지 우리가 완전히 이해하지 못하는 한, 완벽한 안전장치는 존재하지 않습니다.

② AI 규제는 공정한가?
같은 능력을 가진 모델 중 하나만 셧다운된 것은 기술적 근거보다 정치적 판단이 작동했다는 의심을 낳습니다. 규제의 일관성과 투명성이 시급합니다.

③ 클라우드 AI 의존은 안전한가?
정부 명령 하나로 전 세계 사용자가 동시에 서비스를 잃었습니다. 기업들이 단일 AI 공급자에 의존하는 것의 위험성이 현실로 드러났습니다.

 

728x90