에이전트 코딩 · 2026년 6월 23일 ★★★★

프롬프트 인젝션의 정체는 '역할 혼동' — 가짜 추론 끼워넣기, 최신 모델서 60% 통했다

AI 모델이 명령을 누가 보냈는지(시스템·사용자·도구)가 아니라 '어떻게 쓰였는지' 문체만 보고 권한을 판단한다는 점을 파고든 연구예요(ICML 2026 채택). 그래서 권한 있는 역할인 척 흉내 낸 글을 모델이 진짜 지시로 착각하는데, 연구진은 이게 프롬프트 인젝션의 근본 원인이라고 봐요. 특히 가짜 생각의 흐름(추론 블록)을 끼워 넣는 '추론 위조' 공격은 최신 모델에서 약 60퍼센트나 통했어요.

운영자 인사이트

외부 도구나 웹페이지가 준 내용을 입력 단에서 거르는 것만으론 막기 어렵다는 뜻이에요. 같이 다룬 에이전트재킹이 '무슨 일이 벌어지나'라면, 이 연구는 '왜 모델이 도구 출력을 사용자 명령과 구분 못 하나'를 설명해줘요.

원본 보기 (rss:lobsters-ai)