8월 12일 알리바바가 큐원3.8-맥스의 바탕 모델인 Qwen3.8-2.4T-A95B 가중치를 열었어요. 총 2조 4천억·활성 950억짜리 MoE인데, 발표 때는 안 밝혔던 라이선스가 아파치 2.0이 아니라 자체 약관이라 모델을 남에게 서비스하거나 '코딩·오피스 생산성'을 주목적으로 하는 제품으로 12개월 누적 5천만 달러를 넘기면 별도 허락을 받아야 해요. 모델 카드에 실린 터미널벤치 2.1 86.6·SWE-bench Pro 67.7은 알리바바가 클로드 코드 하네스로 직접 잰 맥스 기준 숫자고, 정작 열린 가중치는 시각 입력이 빠지고 맥락도 26만 토큰으로 잘린 판이에요.
용어 풀이
- MoE
- 질문마다 전문가 일부만 깨워 쓰는 구조. 총 크기는 커도 한 번에 도는 건 일부
- SWE-bench Pro
- 실제 저장소의 이슈를 코드로 고치게 시키는 코딩 시험
- 터미널벤치
- 터미널에서 명령을 직접 쳐서 일을 끝내게 하는 에이전트 시험
- BF16
- 가중치를 16비트로 담는 원본 정밀도 형식. 용량이 가장 큼
- FP8
- 가중치를 8비트로 줄인 형식. 메모리와 용량이 절반
운영자 인사이트
가중치가 열렸어도 제품에 그냥 얹을 수 있는 건 아니에요 — 하필 'AI 코딩·오피스 보조'를 콕 집어 매출 문턱을 걸었고, 엔비디아 시연조차 GPU 72장이 든 랙 한 대예요. 지금 손에 쥐고 만져 볼 거면 뒤이어 열리는 270억짜리 쪽이 현실적이에요.
여러 관점으로 보기
- 라이선스 제약 모델을 남에게 서비스하거나 코딩·오피스 보조 제품으로 12개월 누적 5천만 달러를 넘기면 별도 라이선스를 받아야 하고, 월 이용자 1억 명이 넘으면 화면에 모델 이름을 띄워야 해요. Hugging Face
- 굴리는 데 드는 것 엔비디아는 이 모델을 GPU 72장이 한 랙에 든 GB300 NVL72에서 FP8로 돌려 GPU당 초당 4천 토큰을 냈다고 같은 날 밝혔어요. NVIDIA
- 실사용 반론 BF16 원본이 4.9TB, 1비트로 줄여도 397GB라 '대부분의 홈랩용 모델은 아니다'는 반응이고, 4비트를 염두에 둔 학습이 안 돼 있어 누가 대신 줄여 주길 기다리는 처지예요. Hacker News
- 제3자 측정 바깥에서 잰 지표에는 아직 열린 가중치가 없고, 폐쇄판인 맥스만 지능 지수 58점으로 183개 중 10위에 올라 있어요. Artificial Analysis