Claude Code · 2026년 7월 7일 ★★★

모델 말고 '사용하는 사람'을 채점하는 순위표 등장 — 참가자는 만든 사람 1명

SWE-bench나 Elo 점수처럼 AI 모델 실력은 끊임없이 측정하면서, 정작 그걸 다루는 사람의 실력은 아무도 재지 않는다는 문제의식에서 나온 오픈소스 도구예요. Claude Code 세션 기록을 로컬 컴퓨터에서 분석해서 코드 분량·난이도·정리 상태를 종합해 '쓴 토큰 대비 얼마나 성과를 냈는지' 점수를 매기고, 원하면 점수 요약만 골라 공개 순위표에 올릴 수 있어요. 다만 만든 사람이 스스로 올린 사례 말고는 참가자가 없어서, 순위표라기보다는 아이디어를 보여주는 초기 시제품에 가까운 단계예요.

용어 풀이
SWE-bench
실제 소프트웨어 저장소의 버그 수정 작업으로 AI 모델의 코딩 실력을 채점하는 벤치마크
Elo
상대 전적을 기반으로 실력을 숫자로 매기는 순위 점수 체계, 원래 체스에서 쓰던 방식
LOC
코드 줄 수(Lines of Code), 코드 분량을 세는 단위
LLM-as-judge
사람 채점자 대신 언어모델이 결과물 품질을 평가하게 하는 방식
운영자 인사이트

같은 도구·같은 모델을 써도 사람마다 산출물 격차가 크다는 문제의식 자체는 공감이 가지만, 난이도·정리도 판정을 다시 AI에게 맡기는 구조라 엄밀한 비교 지표보다는 개인 회고용 참고 자료 정도로 보는 게 안전해요.

여러 관점으로 보기
  • 프로젝트 개요·프라이버시 정책 코드 분량·난이도·정리 상태를 합쳐 토큰 대비 성과를 매기는데, 판정은 AI 서브에이전트가 맡고 점수 요약 말고는 아무것도 서버로 보내지 않는다고 밝히고 있어요. GitHub
  • 리더보드 현황 공개 리더보드에는 2026년 6월 29일 기준 딱 한 명, 만든 사람 자신의 프로젝트 점수만 올라와 있어요. GitHub Pages

원본 보기 (reddit:claudeai)