에이전트 코딩 · 2026년 8월 8일 ★★★★

딥시크 V4 플래시가 ARC-AGI-2에서 61.4%를 받았어요 — 문제당 0.04달러로 GPT-5.6 루나·제미나이 3.6 플래시를 앞섰지만, 오푸스 5와는 29점 차예요

ARC Prize가 8월 7일 딥시크 V4 플래시 0731의 채점 결과를 '검증됨' 표시와 함께 공개했어요. 밖에 공개하지 않는 문제 묶음에서, 생각 강도를 최대로 올린 설정 기준 ARC-AGI-1 89.0%(문제당 0.02달러)·ARC-AGI-2 61.4%(문제당 0.04달러)로, 같은 값싼 등급인 GPT-5.6 루나(59.6%·0.18달러)와 제미나이 3.6 플래시(60.4%·0.61달러)를 점수와 값 양쪽에서 앞섰어요. 다만 맨 위인 GPT-5.6(92.5%)·오푸스 5(90.4%)와는 30점 안팎 벌어져 있고, 오푸스 5가 30.2%로 1위인 ARC-AGI-3 채점은 아직 안 나왔어요.

용어 풀이
ARC-AGI
색칠된 격자 그림 몇 장만 보고 숨은 규칙을 알아맞히는 추론 시험. 학습 데이터에 없던 문제를 내는 게 목적이라 지식량이 아니라 처음 보는 규칙을 잡아내는 힘을 잼
ARC-AGI-3
ARC-AGI의 3세대 시험. 1·2세대보다 훨씬 어려워 가장 잘하는 모델도 30% 안팎에 그침
ARC Prize
이 시험을 만들고 모델을 직접 돌려 채점 결과를 공개하는 비영리 재단. 모델 만든 회사가 스스로 낸 성적표와 구분됨
운영자 인사이트

ARC는 격자 퍼즐 추론 시험이라 점수가 코딩 실력으로 바로 이어지진 않아요. 같은 등급에서 값이 4분의 1~15분의 1이라는 건 주력을 갈아탈 근거가 아니라 곁가지—두 번째 의견 받기, 대량 리팩터링, 1차 검토—를 싸게 돌려볼 근거예요. 같은 토론에서도 하루 5달러도 못 쓴다는 사람과 한 시간 만에 포기했다는 사람이 갈렸고, 정식판이 미리보기보다 2.5배 느려졌다는 보고도 있어요.

여러 관점으로 보기
  • 위쪽과의 거리 오푸스 5는 같은 시험에서 ARC-AGI-1 97.5%·ARC-AGI-2 90.4%를 받았고, 훨씬 어려운 ARC-AGI-3에서도 30.2%로 1위예요 — 딥시크는 여기 점수가 아직 없어요. ARC Prize
  • 같은 값싼 등급 7월 30일 채점된 GPT-5.6 루나는 ARC-AGI-2 59.6%에 문제당 0.18달러였어요 — 딥시크가 점수는 1.8점 높고 값은 4분의 1 남짓이에요. ARC Prize
  • 실사용 반응 411점·245댓글 토론은 점수보다 값 이야기가 대부분이었고, '하루 5달러도 못 쓴다'는 상시 사용자와 '한 시간 써 보고 포기했다'는 사람이 정면으로 갈렸어요. Hacker News

원본 보기 (hn:top-stories)