딥러닝 모델을 여러 전문가 하위 네트워크로 나누고 입력에 따라 필요한 일부만 활성화하는 기법. 전체 파라미터를 항상 쓰지 않아 계산 비용을 줄일 수 있어 대형 언어모델에서 자주 사용된다.