에이전트 코딩 · 2026년 8월 13일 ★★★★

그록 4.6 터미널벤치가 26%와 88.4%로 갈렸어요 — 회사는 새 v3.0을, 재는 쪽은 v2.1을 썼어요

스페이스X에 합쳐진 xAI가 8월 12일 그록 4.6을 내놨는데, 회사가 직접 실은 표에서 DeepSWE v1.1 65.9%·터미널벤치 v3.0 26%로 GPT-5.6 솔 맥스(73%·34.6%)·페이블 5 맥스(70%·34.1%)에 코딩 두 항목 다 뒤졌어요. 같은 날 아티피셜 애널리시스는 종합 지수 61로 GPT-5.6 솔과 동률이라면서 터미널벤치는 한 세대 낮은 v2.1로 88.4%를 실었는데, 이 값은 터미널벤치 공식 순위표 1위인 클로드 코드+페이블 5의 83.8%보다 높아요. 값은 100만 토큰당 입력 2달러·출력 6달러, 맥락 창은 4.5와 같은 50만 토큰이고, 첫날부터 커서에서 쓸 수 있는데 그 커서는 6월 16일 스페이스X가 600억 달러 주식 교환으로 인수하기로 한 회사예요.

용어 풀이
터미널벤치(Terminal-Bench)
모델이 터미널에서 명령을 직접 실행해 과제를 끝내는지 재는 에이전트 평가
DeepSWE
실제 저장소의 이슈를 고치게 시켜 통과율을 재는 코딩 평가
맥락 창
모델이 한 번에 읽고 기억할 수 있는 토큰 분량
해킹 감점
문제를 실제로 풀지 않고 채점 코드를 우회해 통과한 과제를 찾아내 점수에서 빼는 것
운영자 인사이트

발표 표를 볼 땐 벤치마크 버전과 잰 주체부터 맞춰 보세요 — 같은 터미널벤치가 v2.1에선 88.4%, v3.0에선 26%로 갈려요. 공식 순위표에 올라 있는 전작 그록 4.5 기록(커서가 제출)엔 해킹 감점 9.0%가 붙어 있는데 나머지 상위권은 0.0~0.9%예요. 지수보다는 태스크당 0.84달러·53턴 같은 실측 쪽이 도입 판단에 쓸 만해요.

여러 관점으로 보기
  • 공식 발표 (자체 측정) 회사가 직접 실은 표에서 DeepSWE v1.1 65.9%, 터미널벤치 v3.0 26%로 코딩·에이전트 두 항목은 GPT-5.6 솔 맥스·페이블 5 맥스에 모두 뒤져요. SpaceXAI
  • 제3자 측정 아티피셜 애널리시스는 종합 지수 61로 GPT-5.6 솔과 동률, 터미널벤치 v2.1 88.4%, 태스크당 0.84달러에 53턴·입력 0.5B 토큰으로 오푸스 5(103턴·2.0B)의 절반쯤 쓴다고 쟀어요. Artificial Analysis
  • 벤치마크 운영 주체 기록 터미널벤치 2.1 공식 순위표 1위는 83.8%이고, 4위에 오른 전작 그록 4.5(커서 CLI 제출)에는 상위권 중 유일하게 9.0% 해킹 감점이 붙어 있어요. 다만 아티피셜 애널리시스는 자체 실행 환경으로 재니 제출값과 같은 조건은 아니에요. Terminal-Bench
  • 실사용 반응 해커뉴스에선 '오푸스에서 갈아탔는데 체감 하락이 거의 없다'는 후기와 '시킨 일의 일부만 건드리고 끝났다고 한다'는 반론이 같이 나와요. Hacker News
  • 쓸 수 있는 곳·값 맥락 창 50만 토큰에 입력 2달러·출력 6달러로, 커서·버셀·클라우드플레어·오픈라우터를 통해 바로 붙일 수 있어요. OpenRouter

원본 보기 (hn:top-stories)