Claude Code · 2026년 7월 2일 ★★★

앤트로픽, 클로드 '사이버 탈옥' 신고 창구 재개 — 공격 코드 만들게 하는 탈옥 신고받아요(보상은 없어요)

앤트로픽이 해커원(HackerOne)에서 운영하는 '사이버 탈옥' 신고 프로그램(Cyber Jailbreak VDP)이 7월 1일 다시 접수를 시작했어요. 프런티어 사이버 보안 모델인 페이블 5(Fable 5)를 우회해서, 실제로 동작하는 공격 코드나 악성코드, 공격 인프라를 만들게 하는 것처럼 '사이버 공격에 실질적으로 도움이 되는' 탈옥을 신고받는 창구예요. 다만 버그 바운티와 달리 금전 보상은 없고, 신고 확인과 협력만 약속해요. 이 재개는 6월 12일 미국 정부가 '코드 취약점 점검'을 빙자한 탈옥을 근거로 페이블 5·미토스 5(Mythos 5) 접근을 일시 중단시킨 사안과 맞물려 있어요.

용어 풀이
VDP
Vulnerability Disclosure Program. 취약점을 신고받는 공개 창구로, 버그 바운티와 달리 보통 금전 보상이 없음
탈옥(jailbreak)
AI가 거부하도록 설정된 위험한 답변을 우회 기법으로 끌어내는 행위
버그 바운티(bug bounty)
보안 취약점을 찾아 신고하면 금전 보상을 주는 제도
공격 코드(exploit code)
소프트웨어의 취약점을 실제로 공격하는 데 쓰는 코드
운영자 인사이트

AI에게 '이 코드의 취약점을 봐 줘'라고 시키는 평범한 보안 점검 요청도 탈옥 통로가 될 수 있다는 걸 보여주는 사례예요. 클로드나 클로드 코드(Claude Code)로 보안 리뷰를 자동화하는 팀이라면, 모델이 방어가 아니라 공격용 코드를 만들어내는 경계 지점을 인지하고, 문제를 발견하면 이 무보상 공개 창구로 신고하는 경로를 알아두면 좋아요.

여러 관점으로 보기
  • 프로그램 페이지 클로드를 우회해 공격 코드·악성코드를 만들게 하는 '사이버 탈옥'을 신고받는 무보상 공개 창구예요. HackerOne
  • 발단 사건(공식) 6월 12일 미국 정부가 '코드 취약점 점검'을 빙자한 탈옥을 근거로 프런티어 모델 접근을 일시 중단시켰다고 앤트로픽이 밝혔어요. Anthropic
  • 유료 프로그램과 구분 이 창구와 별개로, 보편적 탈옥을 찾으면 최대 3만5천 달러를 주는 유료 '모델 안전 버그 바운티'도 따로 운영해요(생물·화학 등 위험 영역 중심). Anthropic (Claude Help Center)
  • 커뮤니티 반응 해커뉴스에 올라왔지만 점수 2점·댓글 0개로 반응은 거의 없어요. Hacker News

원본 보기 (hn:anthropic)