ARC Prize가 8월 7일 딥시크 V4 플래시 0731의 채점 결과를 '검증됨' 표시와 함께 공개했어요. 밖에 공개하지 않는 문제 묶음에서, 생각 강도를 최대로 올린 설정 기준 ARC-AGI-1 89.0%(문제당 0.02달러)·ARC-AGI-2 61.4%(문제당 0.04달러)로, 같은 값싼 등급인 GPT-5.6 루나(59.6%·0.18달러)와 제미나이 3.6 플래시(60.4%·0.61달러)를 점수와 값 양쪽에서 앞섰어요. 다만 맨 위인 GPT-5.6(92.5%)·오푸스 5(90.4%)와는 30점 안팎 벌어져 있고, 오푸스 5가 30.2%로 1위인 ARC-AGI-3 채점은 아직 안 나왔어요.
용어 풀이
- ARC-AGI
- 색칠된 격자 그림 몇 장만 보고 숨은 규칙을 알아맞히는 추론 시험. 학습 데이터에 없던 문제를 내는 게 목적이라 지식량이 아니라 처음 보는 규칙을 잡아내는 힘을 잼
- ARC-AGI-3
- ARC-AGI의 3세대 시험. 1·2세대보다 훨씬 어려워 가장 잘하는 모델도 30% 안팎에 그침
- ARC Prize
- 이 시험을 만들고 모델을 직접 돌려 채점 결과를 공개하는 비영리 재단. 모델 만든 회사가 스스로 낸 성적표와 구분됨
운영자 인사이트
ARC는 격자 퍼즐 추론 시험이라 점수가 코딩 실력으로 바로 이어지진 않아요. 같은 등급에서 값이 4분의 1~15분의 1이라는 건 주력을 갈아탈 근거가 아니라 곁가지—두 번째 의견 받기, 대량 리팩터링, 1차 검토—를 싸게 돌려볼 근거예요. 같은 토론에서도 하루 5달러도 못 쓴다는 사람과 한 시간 만에 포기했다는 사람이 갈렸고, 정식판이 미리보기보다 2.5배 느려졌다는 보고도 있어요.
여러 관점으로 보기
- 위쪽과의 거리 오푸스 5는 같은 시험에서 ARC-AGI-1 97.5%·ARC-AGI-2 90.4%를 받았고, 훨씬 어려운 ARC-AGI-3에서도 30.2%로 1위예요 — 딥시크는 여기 점수가 아직 없어요. ARC Prize
- 같은 값싼 등급 7월 30일 채점된 GPT-5.6 루나는 ARC-AGI-2 59.6%에 문제당 0.18달러였어요 — 딥시크가 점수는 1.8점 높고 값은 4분의 1 남짓이에요. ARC Prize
- 실사용 반응 411점·245댓글 토론은 점수보다 값 이야기가 대부분이었고, '하루 5달러도 못 쓴다'는 상시 사용자와 '한 시간 써 보고 포기했다'는 사람이 정면으로 갈렸어요. Hacker News