GitHub Copilot · 2026년 7월 7일 ★★★★

VS Code와 OpenAI, 2주 실험으로 GPT-5.5 프롬프트 다듬어 편집 속도 9%대 개선

VS Code 팀이 OpenAI와 함께 GPT-5.5용 시스템 프롬프트를 두 가지 안으로 나눠 2주간 A/B 테스트를 진행했어요. 그중 에이전트의 작업 흐름 전체를 다시 짠 안이 채택됐는데, 첫 편집까지 걸리는 시간이 최대 9.3%, 평균 도구 호출 횟수는 8.5%, 답변이 길어질 때 쓰는 토큰량은 7.6%까지 줄었다고 해요. VS Code 팀은 이걸 모델이 나온 뒤에도 계속 이어지는 튜닝 과정이라 설명하며, 다른 모델 제공자와도 비슷한 방식으로 맞춰가고 있다고 밝혔어요.

용어 풀이
A/B 테스트
사용자를 그룹으로 나눠 서로 다른 버전을 보여준 뒤 결과를 비교하는 실험 방법
시스템 프롬프트
AI 모델에게 미리 심어두는 역할·행동 지침 문구, 사용자에게는 보이지 않음
토큰
AI가 글을 처리하는 최소 단위, 많이 쓸수록 응답이 느려지고 비용도 늘어남
p50/p95
값을 순서대로 늘어놨을 때 중간(50%) 지점과 상위 5%에 해당하는 값, p95는 안 좋은 축에 속하는 경우를 대표함
하네스(harness)
AI 모델을 실제 프로그램 안에서 움직이게 하는 틀, 문맥 구성·도구 연결·반복 실행 등을 담당
운영자 인사이트

모델을 바꾸지 않고 프롬프트에 '언제 바로 확신하고 행동할지' 기준 하나만 더해도 속도·토큰·도구 호출이 눈에 띄게 줄었다는 사례라, 사내에서 코딩 에이전트를 커스터마이징한다면 이런 식으로 수치 기반 A/B 검증을 해볼 만해요.

여러 관점으로 보기
  • 실험 설계 트래픽을 대조군과 두 실험군으로 나눠 2주간 돌린 A/B 테스트였고, 그중 작업 흐름 전체를 재구성한 안이 최종 채택됐어요. VS Code Blog
  • 결과 수치 채택된 안에서 편집까지 걸리는 시간(p95 기준)이 9.3%, 평균 도구 호출이 8.5%, 총 토큰(p95 기준)이 7.6% 줄었고 통계적으로도 유의했어요. VS Code Blog
  • 더 큰 맥락 (다른 모델도 같은 방식인지) VS Code 팀은 새 모델이 나올 때마다 제공자와 함께 프롬프트·툴 설명·에이전트 루프를 미리 조정한다고 5월 게시물에서도 밝혔는데, 이번 GPT-5.5 실험도 그 흐름의 연장선이에요. VS Code Blog

원본 보기 (rss:vscode-blog)