에이전트 코딩 · 2026년 8월 7일 ★★★★

큐원3.8 맥스의 '에이전트 지수 1위'는 하루를 못 갔어요 — 재는 쪽이 8월 6일 채점을 바꾸자 오푸스 5가 다시 위로 올라갔어요

아티피셜 애널리시스 에이전트 지수에서 큐원3.8 맥스가 오푸스 5를 0.1점 차로 제쳤다는 글이 해커뉴스 상위에 올랐지만, 같은 날 이 회사가 지수 v4.1.1을 내면서 순서가 뒤집혔어요. 지금은 오푸스 5(맥스)가 59로 맨 위고 오푸스 5(x하이)와 큐원3.8 맥스가 나란히 58인데, 바뀐 건 τ³-뱅킹을 tau2-bench v1.0.1 데이터·채점기로 갈아 끼우고 채점 모델을 GPT-5.6 루나로 교체한 거예요. 이 지수는 GDPval-AA v2와 τ³-뱅킹 둘만 같은 비중으로 평균 낸 값이라 코딩 벤치마크는 아예 들어가지 않아요.

용어 풀이
GDPval-AA v2
44개 직업·9개 산업의 실제 업무를, 셸과 웹 브라우저를 쥐여 준 상태로 시켜 보는 평가
τ³-뱅킹
정리 안 된 방대한 문서를 뒤져 가며 여러 단계 도구 호출로 은행 업무를 처리하게 하는 평가
tau2-bench
τ 계열 도구 호출 평가의 공개 데이터·채점기 묶음
MoE
전체 매개변수 중 일부 전문가만 골라 켜서 계산량을 줄이는 구조
운영자 인사이트

순위표로 도입을 판단하기 전에 그 지수가 무엇으로 이뤄졌는지부터 보세요 — 여기서 겨룬 건 사무 과제와 은행 도구 호출 두 벤치마크뿐이고 코딩은 빠져 있어요. 8월 7일 현재 가중치도 라이선스도 안 나와서, 지금 쓸 수 있는 길은 백만 토큰당 입력 2달러·출력 6달러짜리 알리바바 API 하나예요.

여러 관점으로 보기
  • 측정 방식 반론 해커뉴스에서는 '이길 수 있는 지수만 골라 링크했다', '코딩 에이전트 지수는 아예 안 돌렸다'는 지적이 이어졌어요. Hacker News
  • 지수를 만든 쪽의 정정 아티피셜 애널리시스가 8월 6일 v4.1.1을 올리며 τ³-뱅킹 데이터·채점기와 채점 모델을 갈아 끼웠고, 담당자가 그 자리에서 '큐원3.8 맥스가 1위가 아니라 2위로 내려간다'고 적었어요. Artificial Analysis
  • 실제로 쓸 수 있나 — 값과 가중치 공개 백만 토큰당 입력 2달러·출력 6달러로 GPT-5.6 솔의 5달러·30달러보다 싸지만, 가중치 공개는 '다음 주'라는 약속만 있고 아직 안 나왔어요. TechRepublic
  • 알리바바가 내세운 성적 8월 3일 출시 때 알리바바는 2.4조 매개변수 MoE에 100만 토큰 창을 내세우며 터미널벤치 2.1 86.6, 페이퍼벤치 93.0을 공개했어요. MarkTechPost

원본 보기 (hn:top-stories)