Cursor, MoE 훈련 커널 ‘Mixture-of-Kittens’를 오픈소스로 공개하며 GB300 NVL72에서 최대 2.37배 빠른 MoE 훈련을 가능하게 했다.
기사 3줄 요약
- 1Cursor Research가 Composer 모델의 MoE 훈련에 사용한 메가커널 MoK(Mixture-of-Kittens)를 오픈소스로 공개했다.
- 2MoK는 MoE 통신과 계산을 하나의 결정적 커널로 융합해, GB300 NVL72 랙에서 기존 최고 공개 baseline보다 최대 2.37배 빠른 훈련 속도를 낸다.
- 3다만 Blackwell SM100/SM103 GPU가 필요해 NVL72 규모 인프라가 없는 환경에서는 실행할 수 없다.
초등학생도 이해하는 ktoolu 설명
AI 모델이 점점 커지면서 전체 뇌를 한 번에 굴리는 대신, 여러 ‘전문가’ 중 필요한 사람만 불러 쓰는 MoE(전문가 혼합) 방식이 중요해졌어요.
그런데 전문가들이 서로 정보를 주고받는 과정이 많아서 훈련이 느렸는데, MoK는 그 과정을 하나의 큰 작업으로 뭉쳐서 훨씬 빠르게 만든 거예요.
다만 엄청나게 비싼 NVIDIA 전용 서버에서만 돌아가서, 당장 모든 개발자가 쓸 수 있는 건 아니에요.
인사이트 & 시사점
MoE 훈련 커널을 오픈소스로 공개한 것은 초거대 AI 모델을 훈련하는 시간과 비용을 줄이는 핵심 기술을 누구나 비교하고 개선할 수 있는 길이 열렸다는 뜻이다.
소프트웨어 교체만으로 2.37배까지 빨라지는 것은 하드웨어 투자 없이 얻는 큰 비용 절감이라, NVL72 같은 고급 인프라를 확보한 조직들의 경쟁력에 직접 영향을 준다.
다만 최신 Blackwell GPU에 종속된 점은 오픈소스의 이점이 이미 고사양 인프라를 가진 일부에 먼저 돌아갈 수 있음을 보여준다.
용어해설
AI 기반 코드 자동완성 및 개발 도구로, OpenAI와 Anthropic 등 여러 최첨단 AI 모델을 통합해 제공하는 플랫폼이다. 이 기사에서는 스페이스X에 인수된 후 타사 모델을 계속 제공할 수 있을지가 핵심 쟁점이다.
Cursor Research가 공개한 MoE 훈련용 메가커널. MoE 계산과 통신을 하나의 결정적 커널로 융합해, GB300 NVL72 환경에서 최대 2.37배 빠른 훈련 속도를 보인다.
딥러닝 모델을 여러 전문가 하위 네트워크로 나누고 입력에 따라 필요한 일부만 활성화하는 기법. 전체 파라미터를 항상 쓰지 않아 계산 비용을 줄일 수 있어 대형 언어모델에서 자주 사용된다.
NVIDIA의 대규모 AI 서버 랙 시스템. 72개의 Blackwell GPU를 하나의 NVLink 도메인으로 연결해 초대형 모델 훈련을 가능하게 한다. MoK는 Blackwell SM100/SM103 GPU 기반의 이 시스템을 요구한다.