Tessl이 GLM 5.2, MiniMax M3, Kimi K2.7-code, Qwen 3.7-Plus, Sonnet 4.6를 약 1,000개 코딩 에이전트 시나리오로 벤치마크한 결과를 공유했어요. 특히 GLM 5.2와 MiniMax M3가 코딩 에이전트 워크로드에서 Sonnet 4.6에 예상보다 훨씬 근접하거나 앞섰다는 점이 핵심이에요. 각 시나리오를 일반 실행과 스킬(Tessl Registry) 로드 두 번씩 돌렸고, 태스크·평가셋이 Hugging Face에 공개돼 검증 가능한 점도 의미 있어요(작성자는 벤치마크를 수행한 Tessl 소속).
운영자 인사이트
중국 오픈 모델이 코딩 에이전트 작업에서 Sonnet에 바짝 붙었다는, 평가셋까지 공개된 검증 가능한 벤치예요. 비용 최적화 카드가 하나 더 생긴 셈이지만 작성자가 Tessl 소속인 점은 감안하세요.