SWE-bench나 Elo 점수처럼 AI 모델 실력은 끊임없이 측정하면서, 정작 그걸 다루는 사람의 실력은 아무도 재지 않는다는 문제의식에서 나온 오픈소스 도구예요. Claude Code 세션 기록을 로컬 컴퓨터에서 분석해서 코드 분량·난이도·정리 상태를 종합해 '쓴 토큰 대비 얼마나 성과를 냈는지' 점수를 매기고, 원하면 점수 요약만 골라 공개 순위표에 올릴 수 있어요. 다만 만든 사람이 스스로 올린 사례 말고는 참가자가 없어서, 순위표라기보다는 아이디어를 보여주는 초기 시제품에 가까운 단계예요.
용어 풀이
- SWE-bench
- 실제 소프트웨어 저장소의 버그 수정 작업으로 AI 모델의 코딩 실력을 채점하는 벤치마크
- Elo
- 상대 전적을 기반으로 실력을 숫자로 매기는 순위 점수 체계, 원래 체스에서 쓰던 방식
- LOC
- 코드 줄 수(Lines of Code), 코드 분량을 세는 단위
- LLM-as-judge
- 사람 채점자 대신 언어모델이 결과물 품질을 평가하게 하는 방식
운영자 인사이트
같은 도구·같은 모델을 써도 사람마다 산출물 격차가 크다는 문제의식 자체는 공감이 가지만, 난이도·정리도 판정을 다시 AI에게 맡기는 구조라 엄밀한 비교 지표보다는 개인 회고용 참고 자료 정도로 보는 게 안전해요.
여러 관점으로 보기
- 프로젝트 개요·프라이버시 정책 코드 분량·난이도·정리 상태를 합쳐 토큰 대비 성과를 매기는데, 판정은 AI 서브에이전트가 맡고 점수 요약 말고는 아무것도 서버로 보내지 않는다고 밝히고 있어요. GitHub
- 리더보드 현황 공개 리더보드에는 2026년 6월 29일 기준 딱 한 명, 만든 사람 자신의 프로젝트 점수만 올라와 있어요. GitHub Pages